Skip to content

Kimi K3: почему китайская открытая модель на 2,8 трлн параметров стала важным сигналом

16 июля 2026 года пекинский стартап Moonshot AI выпустил Kimi K3 — модель с 2,8 триллиона параметров и заявленным курсом на открытые веса; согласно официальной документации, полные веса ожидаются до 27 июля 2026 года. Релиз был приурочен к Всемирной конференции по искусственному интеллекту в Шанхае и вызвал бурную реакцию в мировом AI-сообществе — от Hacker News до китайских форумов.

Что такое Kimi K3 и чем она отличается

Kimi K3 — это не просто увеличенная версия предыдущей модели K2. Она построена на трёх архитектурных инновациях, которые, по заявлению Moonshot AI, дают примерно 2,5-кратный прирост эффективности масштабирования:

  • Kimi Delta Attention (KDA) — гибридный механизм линейного внимания, улучшающий поток информации через длинные последовательности и глубокие сети.
  • Attention Residuals (AttnRes) — выборочное извлечение представлений по глубине модели вместо равномерного накопления, снижающее деградацию представлений в глубоких слоях.
  • Stable LatentMoE — активация только 16 из 896 экспертов в сочетании с Quantile Balancing и оптимизатором Per-Head Muon для стабильного разреженного обучения.

Модель поддерживает окно контекста в 1 миллион токенов, нативное понимание изображений и видео, а также настраиваемое усилие рассуждения (низкое, высокое, максимальное). Это первая открытая модель, достигшая класса в 3 триллиона параметров — порога, который ранее был исключительной территорией закрытых моделей OpenAI и Anthropic.

Реальность бенчмарков: что показывают тесты

В официальном блоге Moonshot AI прямо указано: по общей производительности Kimi K3 всё ещё уступает самым сильным проприетарным моделям — Claude Fable 5 и GPT-5.6 Sol. Однако модель стабильно превосходит все остальные протестированные модели. Этот нюанс важен в дискуссии, которая часто сводится к бинарным утверждениям «лучше/хуже».

БенчмаркРезультат K3КонтекстИсточник
DeepSWE v1.167,3%Лучший среди открытых моделейDeepSWE leaderboard
Terminal-Bench 2.1Уровень frontierКонкурирует с Fable 5KimiCode harness
Arena Front-End Coding#1Опережает Fable 5 (с fallback)Arena / AP News
SWE MarathonКонкурентоспособенFable 5 — 35% отказов (fallback)SWE Marathon

Показательно, что Claude Fable 5 столкнулся с 35% отказов (fallback) в оценке SWE Marathon, что негативно повлияло на его измеренную производительность. Это осложняет прямые сравнения и подчёркивает важность прозрачности методологии в AI-бенчмарках.

Цены и доступность для разработчиков

API Kimi K3 использует плоскую тарификацию без тарифных уровней: $0,30/MTok для ввода с попаданием в кэш, $3,00/MTok для ввода без кэша и $15,00/MTok для вывода. Аналитики Bank of America отмечают, что это примерно вдвое дешевле GPT-5.6 Sol. Для задач кодирования официальное API достигает более 90% попаданий в кэш, что значительно снижает эффективную стоимость ввода.

ПараметрKimi K3GPT-5.6 SolClaude Fable 5
Цена вывода$15/MTok~$30/MTokНе раскрыта
Открытые весаДа (до 27 июля)НетНет
Контекст1M токенов1M токенов200K токенов
МультимодальностьНативнаяНативнаяНативная
Попадание в кэш>90% (кодинг)Не раскрытаНе раскрыта
Суверенитет данныхВарианты в КитаеСШАСША

Главное преимущество K3 — предстоящий выпуск открытых весов (до 27 июля 2026 года). Разработчики смогут самостоятельно развёртывать, донастраивать и проверять модель. Однако для работы требуются серьёзные ресурсы: Moonshot рекомендует конфигурации супернода с 64 или более ускорителями. Архитектура KDA также создаёт новые сложности для традиционного prefix caching, хотя адаптация для vLLM уже передана сообществу.

Проверка фактов — спор о дистилляции

В феврале 2026 года Anthropic обвинил DeepSeek, Moonshot и MiniMax в «незаконном извлечении возможностей Claude» через дистилляцию. Moonshot публично не ответил на эти обвинения. С выходом K3 этот спор вспыхнул с новой силой. На китайских форумах, в частности на Zhihu, пользователи задаются вопросом: достигнута ли эффективность модели самостоятельно или она зависит от дистилляции фронтьерных моделей?

Anthropic признал, что дистилляция может быть легитимной техникой обучения, но утверждает, что конкуренты «используют её для получения мощных возможностей от других лабораторий за долю времени и стоимости, которые потребовались бы для самостоятельной разработки». Выпуск открытых весов позволит исследовательскому сообществу проверить эти утверждения.

Карта мнений — геополитический контекст и значение для российских разработчиков

Точка зренияПозицияИсточник
ОптимистыK3 доказывает, что открытые модели могут приблизиться к закрытому фронтьеруArena CEO, сообщество
ОсторожныеВопросы дистилляции остаются; нужна независимая проверкаЗаявление Anthropic, фев. 2026
СкептикиРеакция на K3 повторяет хайп вокруг DeepSeek; реальное влияние ограниченоАналитик Patrick Moorhead
ГеополитическиеK3 — симптом усиления конкуренции США и Китая; экспортный контроль дал обратный эффектAP News

Для русскоязычных разработчиков и исследователей Kimi K3 открывает новые возможности. Это единственная открытая модель в классе 3 трлн параметров, что означает доступ к технологии, ранее доступной только через платные API западных компаний. В условиях ограничений на поставки чипов и растущей геополитической напряжённости, наличие открытой альтернативы из Китая может стать важным фактором.

Релиз K3 совпал с выступлением председателя КНР Си Цзиньпина на WAIC, где он призвал к «симфонии глобального сотрудничества, а не сольному выступлению какой-либо одной страны». Huawei в тот же день представила вычислительную систему Atlas 950 SuperPoD — сигнал, что китайская экосистема AI-железа ускоряется, несмотря на — и отчасти благодаря — экспортным ограничениям США.

FAQ

Является ли Kimi K3 полностью открытой?

Moonshot AI обязался выпустить полные веса модели до 27 июля 2026 года. Технический отчёт с деталями архитектуры и обучения будет опубликован позднее.

Сколько стоит Kimi K3?

API: $0,30/MTok (ввод с кэшем), $3,00/MTok (ввод без кэша), $15,00/MTok (вывод). По оценке Bank of America, это примерно вдвое дешевле GPT-5.6 Sol.

Превосходит ли K3 GPT-5.6 Sol и Claude Fable 5?

Официальный блог Moonshot сообщает, что общая производительность K3 всё ещё уступает этим двум моделям. Однако по отдельным бенчмаркам (Arena front-end coding, DeepSWE) K3 лидирует. Fable 5 показал 35% отказов в SWE Marathon, что усложняет прямое сравнение.

В чём суть спора о дистилляции?

Anthropic обвинил Moonshot, DeepSeek и MiniMax в феврале 2026 года в использовании дистилляции для извлечения возможностей Claude. Moonshot публично не ответил. Выпуск открытых весов позволит сообществу провести независимую проверку.

Какое оборудование нужно для запуска K3?

Moonshot рекомендует конфигурации супернода с 64 или более ускорителями. Адаптация для vLLM уже передана open-source сообществу.

Источники

Leave a Reply

Your email address will not be published. Required fields are marked *