New-ZZZ
RU / EN
Модели ИИ 15 июля 2026

Thinking Machines выпустила модель Inkling с триллионом параметров

Р
Редакция New-ZZZ
Hugging Face Blog · 3 недели назад

Thinking Machines выпустила Inkling на Hugging Face, представив его как большую открытую мультимодальную языковую модель, предназначенную для рассуждений на основе текста, изображений и аудио. Модель насчитывает около одного триллиона параметров, поддерживает контекст до одного миллиона токенов и была обучена на 45 триллионах токенов, охватывающих текст, изображения, аудио и видео. Её предполагаемая роль не ограничивается выполнением запросов общего назначения: компания делает акцент на адаптации к предметным областям посредством дообучения и рассматривает Inkling как основу для нового поколения приложений, которым необходимо объединять информацию из нескольких типов медиа. Её ключевая идея — нативные мультимодальные рассуждения в необычно крупном масштабе, агентные возможности и контекстное окно на один миллион токенов.

Inkling — это каузальная авторегрессионная модель только с декодером, то есть она генерирует результат пошагово на основе информации, уже доступной в её контексте. В ней используется разреженная архитектура Mixture-of-Experts с 975 миллиардами параметров в общей сложности, однако для каждого конкретного токена активируется лишь около 41 миллиарда параметров. Такая конструкция призвана обеспечить значительную часть возможностей очень крупной сети без необходимости задействовать каждый параметр на каждом этапе инференса. Модель содержит 256 экспертов. Её маршрутизатор оценивает как маршрутизируемых, так и общих экспертов, выбирает шесть маршрутизируемых экспертов и сохраняет активными двух общих, формируя структуру, которую авторы называют shared-expert sink.

Система внимания отличается от ротационных позиционных представлений, широко используемых в современных языковых моделях. Вместо них Inkling применяет относительное внимание, позволяя каждому слою внимания напрямую обучаться позиционным взаимосвязям через собственные оценки внимания. Помимо стандартных проекций ключей, запросов и значений, система создаёт четвёртый относительный признак — отдельно для каждого токена и каждой головы внимания. Перед включением в расчёт внимания этот признак модифицируется с учётом расстояния между соответствующими позициями ключа и запроса. Цель состоит в том, чтобы кодировать взаимосвязи токенов с учётом расстояния, не полагаясь на RoPE.

Inkling также чередует два паттерна внимания, чтобы сбалансировать охват и вычислительные затраты. Слои глобального внимания могут анализировать весь доступный контекст, тогда как слои со скользящим окном работают в пределах ограниченной перемещающейся области. На каждый слой глобального внимания архитектура использует пять слоёв со скользящим окном, а финальный слой снова применяет глобальное внимание, чтобы сформировать более содержательные представления на основе полного контекста. Эту схему дополняет короткая одномерная свёртка под названием SConv, которая обрабатывает текущее скрытое состояние вместе с предшествующими состояниями внутри своего окна. Заявленная идея состоит в том, что SConv может улавливать локальные закономерности, оставляя модулям внимания и экспертов больше ресурсов для обработки других взаимосвязей.

Для изображений Inkling использует сравнительно простой иерархический MLP-патчификатор вместо крупного независимого визуального энкодера. Последовательные линейные слои постепенно объединяют пиксели, пока система не сформирует по одному эмбеддингу для каждого патча изображения. Визуальная башня также поддерживает дополнительное временное измерение, предназначенное для видеоданных. Thinking Machines ожидает, что эта функция станет полезной после последующего дообучения, однако в опубликованном описании прямо сказано, что качество работы модели с видео без дополнительной настройки пока не оценивалось. Соседние патчи объединяются путём укладки небольшой локальной сетки в измерение каналов перед обработкой иерархическим MLP.

Аудио поступает в общую модель столь же прямым путём. Звуковая волна разделяется на фрагменты длительностью 100 миллисекунд и преобразуется в мел-шкалу — представление, организованное в соответствии с воспринимаемыми человеком звуковыми частотами. Каждый фрагмент классифицируется в один из дискретных интервалов мел-спектрограммы. Значения этих интервалов преобразуются аудиобашней в эмбеддинги, которые затем суммируются для формирования аудиовхода модели. Таким образом, изображения и аудио поступают в декодер через относительно компактные модули эмбеддингов, а не через полностью отдельные тяжеловесные энкодеры. Такой унифицированный подход призван поддерживать рассуждения, пересекающие границы модальностей, вместо обработки каждого типа медиа как изолированной задачи.

Релиз включает полные веса в формате BF16 и калиброванную версию NVFP4, предназначенную для существенного снижения требований к памяти. В него также входят слои спекулятивного предсказания нескольких токенов, призванные ускорить инференс, помогая системе предлагать более одного будущего токена за раз. Даже после квантизации Inkling остаётся крайне требовательной к инфраструктуре: контрольной точке BF16 требуется около 2 ТБ видеопамяти, а контрольной точке NVFP4 — примерно 600 ГБ. Модель BF16 предназначена для оборудования Nvidia поколения Hopper или новее, тогда как контрольная точка NVFP4 ориентирована на графические процессоры Nvidia Blackwell.

Thinking Machines и Hugging Face позиционируют доступность программной поддержки как важную составляющую запуска. Inkling сразу получила поддержку в Transformers и совместимость с основными движками инференса, включая SGLang и vLLM; в материалах релиза также упоминаются квантизации для llama.cpp и GGML как путь к локальному развёртыванию. Пользователи без необходимого оборудования могут обращаться к модели через маршрутизаторы бессерверного инференса, такие как Hugging Face Inference Providers. Для прямого использования через Transformers рекомендуется интерфейс any-to-any pipeline, при этом пользователям предлагается обновиться до Transformers 5.14.0.

Сочетание открытых весов, мультимодальных входных данных, разреженной маршрутизации экспертов, длинного контекста и интеграции с распространёнными системами инференса делает Inkling прежде всего платформой для экспериментов и специализированной адаптации, а не обычной настольной моделью. Её практическая доступность будет в значительной степени зависеть от облачных сервисов, агрессивной квантизации или крупных систем с графическими процессорами, несмотря на эффективность, достигаемую благодаря одновременной активации лишь 41 миллиарда параметров. В описании запуска сообщается о демонстрациях и исследовании архитектуры командой Hugging Face, однако не приводятся результаты бенчмарков или подтверждения качества нативной работы с видео. Поэтому заявления о пригодности модели для мультимодальных приложений следует отделять от возможностей, которые пока не прошли формальную оценку.

Почему это важно

  • Inkling объединяет нативную обработку текста, изображений и аудио с контекстным окном на один миллион токенов в открытой модели.
  • Её разреженная архитектура активирует 41 миллиард из 975 миллиардов параметров, стремясь сочетать огромную ёмкость с более низкой стоимостью инференса.
  • Поддержка с первого дня в популярных инструментах инференса может ускорить исследования и разработку специализированных мультимодальных приложений.

Ключевые факты

  • Inkling насчитывает 975 миллиардов параметров, из которых 41 миллиард активен, а также 256 экспертов.
  • Модель обучена на 45 триллионах токенов текста, изображений, аудио и видео.
  • Для контрольной точки в формате BF16 требуется около 2 ТБ видеопамяти, а для версии NVFP4 — примерно 600 ГБ.
  • Архитектура объединяет относительное внимание, внимание со скользящим окном и глобальное внимание, SConv и мультимодальные башни эмбеддингов.
  • В качестве вариантов развёртывания поддерживаются или упоминаются Transformers, SGLang, vLLM и llama.cpp.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы