Springboards создает Flint, чтобы сделать LLM менее повторяющимися
Большие языковые модели часто представляют как гибкие, творческие системы, но в статье утверждается, что многие из них ведут себя удивительно повторяющимся образом, когда им задают открытые вопросы. Простой пример — промпт «Назови случайное число от 1 до 10»: популярные чат-боты вроде ChatGPT, Claude и Gemini часто выбирают 7, а затем обычно переходят к небольшому набору знакомых альтернатив вроде 3, 4, 8 или 9. Смысл не в том, что они всегда так делают, а в том, что их поведение гораздо более предсказуемо, чем считают многие пользователи. Для задач, где важна последовательность, например помощи с кодом или исследовательской работы, такая предсказуемость может быть полезной. Но для мозгового штурма, брендинга, идей для путешествий или другой творческой работы она может создавать своего рода машинно-сгенерированное групповое мышление.
Австралийский стартап Springboards пытается решить это ограничение с помощью языковой модели под названием Flint. По словам сооснователя и CEO Pip Bingemann, Flint создана для того, чтобы выдавать более широкий диапазон ответов на открытые промпты, даже если эти ответы менее традиционны. Bingemann формулирует это почти провокационно: пока большинство разработчиков моделей пытаются уменьшить галлюцинации, Springboards говорит, что «приветствует» их в том конкретном смысле, что хочет получать более неожиданные, менее стандартизированные результаты. В демо ChatGPT и Claude оба дали ожидаемый ответ 7 на промпт со случайным числом, тогда как Flint после одной обычной попытки выдала гораздо менее типичное число 3,7916. Та же закономерность проявилась и в других промптах: когда попросили назвать тип автомобиля, массовые модели склонялись к Toyota или Honda, а Flint предложила Ford F-150. Когда попросили придумать слоган для беговых кроссовок New Balance, Claude и ChatGPT оба выдали «Run your way», а Flint дала другую, пусть и всё ещё несовершенную, фразу.
Центральная проблема в том, что многие LLM не просто повторяются внутри одной модели; они также сходятся друг с другом, выдавая похожие ответы у разных компаний и семейств моделей. Статья связывает позиционирование Springboards с растущей исследовательской обеспокоенностью. В работе под названием «Artificial Hivemind: The Open-Ended Homogeneity of Language Models (and Beyond)» обнаружили высокий уровень повторяемости среди языковых моделей, когда им задавали открытые вопросы. Исследователи протестировали 25 моделей, включая ведущие американские системы и open-source модели из Китая и других стран, и попросили каждую из них 50 раз написать метафору о времени. Многие из 1 250 ответов группировались вокруг знакомых идей вроде «время — это река» или «время — это ткач». Работа получила награду best paper на NeurIPS, что показывает: это становится серьёзной темой в исследованиях ИИ, а не просто забавной особенностью чат-ботов.
Точная причина пока не ясна, но статья указывает на правдоподобное объяснение: многие современные LLM обучаются похожими способами, на похожих типах данных и оптимизируются под похожие цели. Если модели вознаграждаются за связные, безопасные, привычные, высоковероятные ответы, они могут естественным образом попадать в одни и те же колеи. OpenAI, отвечая на эту проблему, говорит, что обучение ради надёжности и связности может подталкивать модели к знакомым ответам, тогда как слишком сильное давление в сторону новизны может ослабить надёжность. Компания также отмечает, что в исследовательской работе рассматривались модели 2024 года, которые с тех пор были обновлены. Этот ответ подчёркивает компромисс в центре дискуссии: пользователи хотят, чтобы модели были точными и надёжными, но также хотят инструменты, которые способны удивлять, когда задача творческая.
Статья приводит повседневные примеры этой одинаковости. Сооснователь и CTO Springboards Kieran Browne говорит, что большинство чат-интерфейсов заставляют пользователей чувствовать, будто они ведут личный разговор, хотя многие люди получают очень похожие результаты. Например, когда просят предложить названия групп, многие модели склонны использовать слова вроде «glass», «neon», «velvet» или «static». В собственном тесте статьи ChatGPT предложил названия, включая «Glass Harbor», «Static Empire», «Neon Hearts» и «Velvet Echo», а Gemini предложил «Static Horizon». Некоторые из этих вариантов могут звучать пригодно, но часто они оказываются универсальными или уже занятыми, как показал случай с «Sofa Astronauts», который оказался названием уже существующей группы.
Более широкий продукт Springboards ориентирован на творческих специалистов в рекламе и маркетинге. Его инструмент позволяет пользователям собирать и перемещать текст, сгенерированный несколькими моделями, включая ChatGPT и Claude, а затем объединять самые сильные фрагменты в новые идеи. Flint позиционируется как ещё один вариант модели внутри этого рабочего процесса, специально для моментов, когда пользователям нужно больше разнообразия, а не тот же отполированный, усреднённый ответ. Стартап не утверждает, что новизна всегда лучше; он делает ставку на то, что творческим командам нужна контролируемая непредсказуемость как часть процесса. В таком контексте странный или несовершенный ответ всё равно может быть полезен, если он ломает шаблон и даёт людям новое направление для исследования.
Более широкий вывод в том, что «креативность» LLM может зависеть не столько от сырого размера модели, сколько от того, как модели обучают, донастраивают и сэмплируют. Если многие системы оптимизируются так, чтобы избегать риска и выбирать наиболее статистически комфортный ответ, они могут стать менее полезными для задач, где важна оригинальность. Подход Flint предлагает другую цель дизайна: вместо того чтобы считать любой необычный вывод дефектом, он пытается оставить место для более разнообразных ответов, при этом оставаясь полезным для практической творческой работы. Это может и не заменить массовые универсальные модели, но может стать ценным дополнением к ним, особенно для пользователей, которым надоело получать те же слоганы, метафоры, названия и идеи, что и все остальные.
Почему это важно
- —Это подсвечивает практическую слабость массовых LLM: они часто дают похожие, высоковероятные ответы, когда пользователям нужны оригинальные идеи.
- —Проблема важна для рекламы, брендинга, нейминга, планирования путешествий и других творческих задач, где однообразие снижает ценность.
- —Flint указывает на возможную новую категорию моделей: AI-системы, настроенные на разнообразие и контролируемую неожиданность, а не только на надежность.
Ключевые факты
- Springboards, австралийский стартап, создал LLM под названием Flint, которая разработана для более разнообразных ответов на открытые запросы.
- В статье показано, что массовые модели часто сходятся к похожим ответам, например выбирают 7 в запросах о случайном числе или используют знакомые слова в вариантах названий групп.
- Лучшая статья NeurIPS “Artificial Hivemind” выявила сильную однородность ответов у 25 языковых моделей, протестированных на открытых запросах.
- OpenAI говорит, что обучение надежности и связности может заставлять модели сходиться к знакомым ответам, тогда как более сильная новизна может снижать надежность.
- Springboards планирует предложить Flint внутри инструмента для брейнсторминга, которым пользуются творческие специалисты в рекламе и маркетинге.
Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.