22580: от GPT-2 до Kimi K3, объяснение Полный перевод X Article о пути архитектур LLM от GPT-2 к Kimi K3: KV cache, linear attention, DeltaNet, KDA, MoE, MLA и AttnRes.
Как ведущие AI-лаборатории строят RL-агентов в 2026 году (используя идею Карпати об обучении через system prompt) Как Anthropic, OpenAI и DeepSeek сходятся к единой идее: использовать system prompt как функцию вознаграждения. Полный разбор эволюции RL — от RLHF до RULER — с кодом.
Сеть инференса LLM нового поколения: как ZCube снимает сетевые bottleneck Z.ai, Harnets.AI и Tsinghua University показали ZCube: сетевую архитектуру для LLM-инференса, которая снижает CapEx на 33%, повышает throughput на 15% и уменьшает TTFT P99 на 40,6%.