New-ZZZ
RU / EN

Энкодеры LFM2.5 ускоряют обработку длинного контекста в NLP на CPU

Р
Редакция New-ZZZ
Hugging Face Blog · 1 неделю назад

Liquid AI представила LFM2.5-Encoders — пару компактных языковых энкодеров общего назначения, предназначенных для производственных задач, в которых необходимо быстро и недорого обрабатывать длинные документы. Семейство включает модели с 230 и 350 миллионами параметров, обе поддерживают контекст объёмом до 8 192 токенов. Они ориентированы на такие задачи, как классификация документов, маршрутизация намерений, извлечение информации, фильтрация небезопасного контента, проверка соблюдения политик, обнаружение персональных данных и поиск. В отличие от генеративных больших языковых моделей, которые создают текст по одному токену за раз, энкодеры оптимизированы для понимания и оценки всего входного текста целиком, что делает их более эффективным выбором для повторяющихся задач обработки языка.

Модели относятся к тому же семейству, что и ранее выпущенные LFM2.5-Retrievers, созданные специально для многоязычного поиска. Однако новые энкодеры имеют более широкое назначение. Они проходят предварительное обучение с помощью маскированного языкового моделирования: части текста скрываются, а модель учится восстанавливать их на основе окружающего контекста. Такой метод обучения позволяет разработчикам дообучать одну и ту же базовую модель для классификации на уровне документов, разметки на уровне токенов, извлечения информации или поиска. Ключевая идея заключается в том, что поиск — лишь одно из применений энкодера, поэтому основа общего назначения полезнее, чем простая переупаковка специализированного ретривера.

Liquid AI создала энкодеры на основе декодерных архитектур LFM2.5-230M и LFM2.5-350M. Исходные каузальные декодеры были преобразованы в двунаправленные модели, благодаря чему каждый токен может учитывать слова, расположенные как до, так и после него. Их короткие свёрточные слои также были преобразованы из каузальных в операции с симметричным дополнением, чтобы локальные признаки могли объединять информацию из соседних токенов с обеих сторон. Во время обучения маскировалось 30% входных токенов. На начальном этапе использовались большой веб-корпус и контекст в 1 024 токена для формирования широких языковых компетенций, после чего проводилась адаптация к длинному контексту в 8 192 токена на более разнообразной смеси данных, предназначенной для усиления фактологических, юридических и многоязычных возможностей.

Оценка охватывала 14 моделей и 17 задач из наборов GLUE, SuperGLUE и многоязычных бенчмарков классификации. Каждая модель отдельно полностью дообучалась для каждой задачи, а опубликованный результат усреднялся по пяти отложенным случайным начальным значениям, чтобы снизить вариативность между запусками. Liquid AI заявляет, что открыла исходный код как фреймворка оценки, так и необработанных результатов. LFM2.5-Encoder-350M заняла четвёртое место среди всех 14 моделей; три системы, опередившие её, были крупнее, включая одну модель с 3,5 миллиарда параметров — почти в десять раз больше. Модель 230M превзошла ModernBERT-base и все протестированные модели EuroBERT, несмотря на то что была меньше большинства из них. Оба новых энкодера также значительно превзошли специализированные LFM2.5-Retrievers компании в рамках этой более широкой оценки.

Наиболее выраженное преимущество проявляется при инференсе на CPU с длинным контекстом. Поскольку и LFM2.5-Encoders, и ModernBERT поддерживают входные последовательности длиной до 8 192 токенов, Liquid AI сравнила их производительность во всём поддерживаемом диапазоне. Энкодер 230M оказался самой быстрой моделью на CPU при каждой протестированной длине последовательности, включая короткие входные данные, где он превзошёл меньшую ModernBERT-base. По мере увеличения длины документов пропускная способность ModernBERT резко снижалась, тогда как модели LFM2.5 сначала перемещались в середину диапазона производительности, а затем замедлялись постепенно. При длине 8 192 токена ModernBERT-base, согласно отчёту, требовалось более 90 секунд на один прямой проход, тогда как LFM2.5-Encoder-230M — около 28 секунд, что обеспечивало примерно 3,7-кратное преимущество в скорости.

Согласно анонсу, этот результат означает, что разработчик может просканировать или классифицировать полный текст договора, расшифровку разговора или продолжительную переписку со службой поддержки менее чем за 30 секунд, используя CPU ноутбука. Результаты на GPU продемонстрировали схожую картину, но с меньшей разницей. ModernBERT-base лидировала при длине менее примерно 1 000 токенов на GPU Apple, тогда как LFM2.5-Encoders выходили вперёд начиная приблизительно с 2 000 токенов. Таким образом, сравнение позиционирует новые модели прежде всего как эффективные системы для обработки длинных входных данных, особенно полезные при отсутствии специализированного GPU.

Liquid AI продемонстрировала модели на примере нескольких дообученных приложений, работающих в Hugging Face Spaces исключительно на CPU. Маршрутизатор промптов с нулевым обучением позволяет пользователям описывать направления маршрутизации естественным языком и за один проход оценивает соответствие всего промпта каждому направлению. Демонстрационная система проверки политик сопоставляет текст с корпоративными правилами, сформулированными в виде инструкций в свободной форме, и одновременно оценивает каждый токен относительно каждого правила. Другие демонстрации включают потокеновое исправление орфографии, а также обнаружение или удаление 40 категорий персональных данных на 16 языках. Экспериментальный чат-бот на основе маскированной диффузии также генерирует текст, последовательно раскрывая замаскированные токены, а не создавая традиционную последовательность слева направо.

Для высоконагруженных задач понимания текста компания предлагает специализированный энкодер, который может быть меньше, быстрее и значительно дешевле генеративной LLM, работая при этом на уже имеющихся CPU. Версия 350M представлена как вариант для задач, где приоритетом является точность, а модель 230M предназначена для ограниченного оборудования и более высокой пропускной способности. Разработчики могут загрузить любую из моделей через библиотеку Transformers, использовать её напрямую для предсказания замаскированных токенов либо добавить выходной слой для конкретной задачи и полностью дообучить энкодер для классификации, маршрутизации, извлечения, оценки или другого прикладного сценария.

Почему это важно

  • Компактные энкодеры могут выполнять непрерывную классификацию, маршрутизацию, извлечение данных и задачи обеспечения безопасности без затрат, характерных для генеративных LLM.
  • Сообщается, что модель на 230 млн параметров обрабатывает входные данные объёмом 8 192 токена на CPU примерно в 3,7 раза быстрее, чем ModernBERT-base.
  • Высокие результаты в бенчмарках показывают, что небольшие модели с тщательно продуманной архитектурой могут конкурировать со значительно более крупными энкодерами.

Ключевые факты

  • Семейство включает двунаправленные энкодеры на 230 млн и 350 млн параметров с контекстным окном в 8 192 токена.
  • В рамках оценки сравнили 14 моделей на 17 задачах классификации из наборов GLUE, SuperGLUE и мультиязычных бенчмарков, усреднив результаты по пяти начальным значениям.
  • LFM2.5-Encoder-350M занял четвёртое место в общем рейтинге, уступив трём более крупным моделям.
  • При обработке 8 192 токенов один прямой проход модели на 230 млн параметров на CPU занял около 28 секунд, тогда как ModernBERT-base потребовалось более 90 секунд.
  • Демонстрации работы исключительно на CPU охватывают маршрутизацию промптов, проверку политик, исправление орфографии, обнаружение персональных данных на разных языках и генерацию методом маскированной диффузии.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы