New-ZZZ
RU / EN

Kimi K3 расширяет масштаб открытых ИИ-моделей до 2,8 триллиона параметров

Р
Редакция New-ZZZ
kimi.com · 3 недели назад

Kimi представила Kimi K3 — нативную мультимодальную модель с 2,8 триллиона параметров, контекстным окном объёмом до одного миллиона токенов и встроенными возможностями компьютерного зрения. Компания называет её первой открытой моделью в классе примерно трёх триллионов параметров и своей самой мощной системой на сегодняшний день. Она предназначена для выполнения сложных и длительных задач, включая разработку программного обеспечения, исследования, работу со знаниями и комплексные рассуждения. Kimi признаёт, что K3 в целом всё ещё уступает сильнейшим проприетарным системам, но утверждает, что модель достигла результатов передового уровня по всему набору тестов и стабильно превзошла другие протестированные модели.

Модель доступна через Kimi.com, Kimi Work, Kimi Code и Kimi API. На момент запуска она по умолчанию работает с максимальной глубиной рассуждений. В последующих обновлениях планируется добавить режимы с меньшими и большими вычислительными усилиями, что должно предоставить пользователям больше контроля над балансом между скоростью, вычислительными затратами и качеством ответов. Kimi координирует работу с поставщиками инфраструктуры для инференса и разработчиками ПО с открытым исходным кодом, чтобы согласовать детали реализации перед более широким развёртыванием в экосистеме. Компания заявляет, что полные веса модели будут опубликованы к 27 июля 2026 года, а в готовящемся техническом отчёте будет представлена более подробная информация об архитектуре, процессе обучения и оценках.

K3 продолжает усилия Kimi по расширению пределов масштаба открыто публикуемых моделей. По данным компании, в течение девяти из предыдущих двенадцати месяцев системы Kimi задавали верхнюю границу масштаба открытых моделей. Однако главным достижением считается не только размер. В K3 используются Kimi Delta Attention и Attention Residuals — два архитектурных изменения, призванных эффективнее передавать информацию как по длинным последовательностям, так и между многочисленными слоями сети. Кроме того, модель отличается повышенной разреженностью архитектуры Mixture-of-Experts: при каждом вычислении активируются лишь 16 из 896 специализированных экспертных компонентов, работающих совместно с фреймворком Stable LatentMoE. Такая избирательная активация должна обеспечивать огромную общую ёмкость модели без необходимости задействовать каждый параметр для обработки каждого токена.

Как сообщается, в сочетании с обновлёнными данными и методами обучения эти изменения обеспечивают примерно в 2,5 раза более высокую общую эффективность масштабирования по сравнению с Kimi K2. На практике, по утверждению Kimi, K3 эффективнее своей предшественницы преобразует заданный объём вычислительных ресурсов в полезные возможности. Контекстное окно на миллион токенов и архитектурные изменения особенно важны для длительных задач, в которых модель должна сохранять и связывать информацию из крупных кодовых баз, объёмных документов, результатов работы инструментов и ранее принятых решений.

Kimi особо подчёркивает способность K3 выполнять продолжительные инженерные задачи при минимальном контроле со стороны человека. Как сообщается, модель способна поддерживать длительные сессии программирования, исследовать очень крупные репозитории и координировать работу инструментов командной строки. Нативная система компьютерного зрения также позволяет ей совмещать разработку ПО с визуальной обратной связью. K3 может анализировать скриншоты и другие визуальные материалы в процессе доработки игр, фронтенд-интерфейсов, проектов автоматизированного проектирования и интерактивных трёхмерных приложений. Заявленный рабочий процесс «vision in the loop» означает, что модель может писать код, проверять отрендеренный результат, выявлять визуальные или функциональные проблемы и вносить последовательные улучшения, а не полагаться исключительно на текстовые описания.

В одном из тестов моделям предоставили до 24 часов работы в идентичных изолированных средах для оптимизации четырёх задач, связанных с GPU-ядрами. Они охватывали нагрузки, относящиеся к Attention Residuals, Kimi Delta Attention и ядру многоголового латентного внимания с размерностью головы 512, работающему на оборудовании NVIDIA H200 и графическом процессоре общего назначения другого производителя. Kimi сообщает, что K3 оказалась конкурентоспособной по сравнению с Claude Fable 5 в тесте, который, возможно, включал резервное поведение, и при этом значительно превзошла Opus 4.8, GPT 5.6 Sol и GPT 5.5. Компания отмечает, что показатели Fable 5 были получены от третьей стороны, а в некоторых траекториях моделей использовалось небольшое снижение числовой точности, остававшееся в пределах допустимой погрешности. Ранняя версия K3 также выполнила бо́льшую часть работы команды Kimi по оптимизации ядер на заключительных этапах разработки.

Затем компания проверила, способна ли модель создать целую систему программирования для GPU, а не просто улучшать отдельные ядра. K3 разработала MiniTriton — компактный компилятор, основанный на общем подходе Triton. В него вошли промежуточное представление на уровне тайлов, построенное поверх MLIR, проходы оптимизации компилятора, конвейер генерации PTX, фронтенд предметно-ориентированного языка и среда выполнения. По словам Kimi, в поддерживаемых тестах производительности по модели Roofline MiniTriton сравнялся с Triton и torch.compile или превзошёл их, в том числе обойдя Triton в некоторых нагрузках.

MiniTriton также протестировали на полном цикле обучения nanoGPT. Как сообщается, система сохраняла стабильную сходимость, а её кривая функции потерь оставалась близкой к эталонной, несмотря на небольшие расхождения. Это важно, поскольку реалистичное обучение проверяет взаимодействие всех компонентов конвейера компилятора, тогда как быстрый результат в узком микротесте ещё не доказывает надёжность системы в целом. Kimi утверждает, что эксперимент демонстрирует способность K3 проектировать целостный компилятор — от программного интерфейса и промежуточных преобразований до генерации машинного кода и его исполнения. По имеющимся данным, недавно созданный путь для Tensor Core уже способен конкурировать с тщательно оптимизированной реализацией Triton.

Отдельный эксперимент расширил сферу работы модели с программного обеспечения до проектирования аппаратного обеспечения. В ходе одного автономного запуска продолжительностью 48 часов ранняя версия K3 спроектировала, оптимизировала и верифицировала чип, предназначенный для работы небольшой модели на основе её собственной архитектуры. Для этого использовались инструменты автоматизации проектирования электроники с открытым исходным кодом и библиотека Nangate с техпроцессом 45 нанометров. Согласно результатам симуляции, полученная конструкция занимала менее четырёх квадратных миллиметров, соответствовала временным ограничениям при частоте 100 МГц и обрабатывала более 8 700 декодированных токенов в секунду. Она содержала 1,46 миллиона стандартных ячеек, 0,277 МБ SRAM и массив умножения-накопления INT4 со встроенной деквантизацией. Эксперимент представлен как свидетельство того, что одна модель способна объединять рассуждения, программирование, визуальный анализ, создание компиляторов и проектирование чипов в рамках необычайно длительных автономных рабочих процессов. Эти результаты пока представлены самой компанией, поэтому предстоящие технический отчёт и публикация открытых весов будут важны для их независимой проверки.

Почему это важно

  • Kimi K3 поднимает планку масштаба ИИ с открытыми весами, сочетая контекстное окно на миллион токенов с нативным зрением.
  • Его продолжительные демонстрации возможностей программирования выходят за рамки генерации кода и охватывают оптимизацию GPU, создание компиляторов и проектирование микросхем.
  • Планируемая публикация полных весов может предоставить исследователям и поставщикам инфраструктуры доступ к модели, близкой по возможностям к передовым проприетарным решениям.

Ключевые факты

  • Kimi K3 насчитывает 2,8 триллиона параметров, активирует 16 из 896 экспертов и поддерживает контекстное окно на один миллион токенов.
  • По данным Kimi, благодаря улучшениям архитектуры и процесса обучения эффективность масштабирования примерно в 2,5 раза выше, чем у Kimi K2.
  • Модель создала MiniTriton — компактный GPU-компилятор, который, согласно имеющимся данным, сравнялся с Triton и torch.compile или превзошёл их в поддерживаемых тестах.
  • В ходе 48-часовой автономной работы ранняя версия K3 спроектировала и верифицировала симулированную 45-нм микросхему, обеспечивающую более 8 700 токенов в секунду.
  • Полные веса модели планируется опубликовать к 27 июля 2026 года вместе с дополнительной технической документацией.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы