New-ZZZ
RU / EN
Модели ИИ 2 сентября 2026

Anthropic представила Claude Fable 5.1 и модель Mythos 5.1 с ограниченным доступом

Р
Редакция New-ZZZ
anthropic.com · 20 часов назад

Anthropic представила Claude Fable 5.1 и Claude Mythos 5.1, назвав их своими наиболее мощными моделями для разработки программного обеспечения, интеллектуальной работы и исследовательских задач. Оба продукта используют одну и ту же базовую модель, но имеют разные конфигурации безопасности. Fable 5.1 предназначена для широкого доступа, тогда как Mythos 5.1 доступна только в рамках программ доверенного доступа, средства контроля которых адаптированы для работы с чувствительными данными в сфере кибербезопасности и наук о жизни. Anthropic также называет формирующиеся исследовательские способности моделей ранним свидетельством того, как всё более мощные системы ИИ смогут способствовать научному прогрессу.

Этот релиз сочетает заявленное повышение производительности с изменениями, призванными сделать передовые, длительно выполняющиеся рабочие процессы с ИИ дешевле и доступнее для внедрения предприятиями. По оценке Anthropic, при типичных сценариях с оплатой по количеству токенов Fable 5.1 будет стоить примерно на 25% дешевле, чем Fable 5. Снижение обусловлено уменьшением стоимости чтения кэша — повторного использования уже обработанных и сохранённых входных данных. В рабочих процессах, которые активно задействуют автономных агентов и многократно используют один и тот же контекст, экономия может оказаться больше и потенциально достигать примерно 45%. Anthropic утверждает, что при настройках Low или Medium модель Fable 5.1 способна демонстрировать производительность на уровне Fable 5 или превосходить её при значительно меньшей стоимости. При этом уровень усилий по умолчанию различается в зависимости от продукта: High в Claude Code и Medium в Claude Cowork и Claude.ai.

Конфиденциальность корпоративных данных — ещё одна центральная тема анонса. Anthropic разрабатывает Enterprise Frontier Safeguards, или EFS, — систему, призванную сочетать защиту от злоупотреблений с конфиденциальностью, эквивалентной политике нулевого хранения данных. Вместо хранения отслеживаемых данных в инфраструктуре, контролируемой Anthropic, EFS размещает их в облачной инфраструктуре, полностью подконтрольной клиенту. Компания планирует поэтапно внедрять систему для корпоративных клиентов, начиная с более позднего периода этой осени. До тех пор, пока внедрение не охватит их, соответствующие требованиям клиенты смогут использовать Fable 5.1 на условиях нулевого хранения данных.

Anthropic также заявляет, что повысила точность своих защитных механизмов, чтобы снизить вероятность блокировки правомерных запросов. По имеющимся данным, в сфере кибербезопасности новейшие средства контроля дают на 60% меньше ложноположительных срабатываний по сравнению с предыдущей системой. Обновлённая политика позволяет Fable 5.1 помогать в выявлении уязвимостей программного обеспечения, однако не разрешает модели разрабатывать эксплойты для этих уязвимостей. Для расширенных возможностей в области биологии Anthropic совместно с правительством США создала программу контролируемого доступа к Mythos 5.1. Ожидается, что учёные смогут подать заявки на участие, хотя точная дата в анонсе не указана.

Компания подкрепляет заявления о производительности результатами тестов в области программирования, науки, интеллектуальных задач и экономической эффективности, включая Terminal-Bench-Science 0.1, Terminal-Bench 4.0, Humanity’s Last Exam и CursorBench 3.2.0. Anthropic отмечает, что стандартная ошибка в Terminal-Bench-Science составляет примерно от 3,5 до 4,5 процентного пункта для каждой модели, поэтому небольшие различия в результатах могут быть следствием статистического шума. Собственная система оценки компании воспроизвела общедоступные результаты Claude Opus 5 и Fable 5 в пределах этого диапазона погрешности. На графиках стоимости модели сравниваются при нескольких уровнях усилий с использованием логарифмических шкал, что подчёркивает соотношение возможностей и затрат, а не только производительность.

Поскольку Fable 5.1 и Mythos 5.1 обладают одним и тем же базовым интеллектом, Anthropic объясняет различия между их результатами в тестах воздействием прежних, менее точных защитных механизмов в сфере кибербезопасности. Компания ожидает, что после внедрения недавно анонсированных улучшений безопасности этот разрыв сократится. Это различие имеет значение, поскольку указывает на то, что ограничения, а не качество базовой модели, могут существенно влиять на измеряемую производительность в задачах, напоминающих работу в области безопасности.

Anthropic утверждает, что Fable 5.1 лучше справляется с длительными рассуждениями и устранением первопричин программных сбоев, не прибегая к обходным решениям, которые лишь скрывают симптомы. Наиболее яркий пример связан с инвестиционной компанией Millennium. Согласно приведённой истории, во внутренней программе происходил чрезвычайно редкий сбой — примерно один раз на миллион запусков, — причину которого инженеры и другие модели не могли установить в течение четырёх-пяти лет. Сообщается, что Fable 5.1 дизассемблировала библиотеку стороннего поставщика, сопоставила её с дампом памяти и проследила источник сбоя до дефекта внутри этой внешней библиотеки. Этот пример приводится как доказательство того, что модель способна выполнять технически сложную диагностическую работу, ручное проведение которой было бы трудно оправдать с точки зрения затрат.

Партнёры с ранним доступом отметили как количественные, так и качественные улучшения. Один из них сообщил, что Fable 5.1 решила больше внутренних задач по программированию, чем Fable 5 или Opus 5, достигла передового уровня в оценке интуитивного понимания трейдинга и сохраняла понятность изложения при выполнении длительных многоэтапных заданий, тогда как за рассуждениями предыдущих моделей становилось трудно следить. Cognition заявила, что планирует с момента запуска перевести трафик Opus 5 в своём ИИ-агенте для программирования Devin на Fable 5.1, поскольку в ходе тестирования новая модель показала результаты на уровне Fable 5 или немного превзошла её, одновременно снизив стоимость выполнения одной задачи. По имеющимся данным, уменьшение стоимости чтения кэша сделало использование модели класса Fable экономически оправданным для рабочих процессов, которые прежде поручались Opus, начиная с проверки кода.

В совокупности анонс позиционирует Fable 5.1 как практическое обновление для агентного программирования и сложной профессиональной работы, а Mythos 5.1 — как ограниченный путь к наиболее чувствительным научным возможностям и функциям безопасности той же модели. Эти заявления по-прежнему основаны главным образом на тестах Anthropic и свидетельствах партнёров, однако сочетание снижения стоимости кэшированного контекста, подконтрольной клиентам инфраструктуры защитных механизмов, уменьшения числа ложноположительных срабатываний и улучшенного решения долгосрочных задач может существенно повлиять на выбор организациями моделей для ИИ-агентов, помогающих в программировании, исследовательской деятельности и корпоративной автоматизации.

Почему это важно

  • Снижение стоимости чтения кэша может существенно сократить расходы на длительно работающих ИИ-агентов для программирования и другие ИИ-процессы, активно использующие контекст.
  • Защитные механизмы под управлением клиентов призваны совместить конфиденциальность корпоративных данных с защитой от злоупотреблений.
  • Программа Mythos с ограниченным доступом показывает, что доступ к передовым возможностям в сфере кибербезопасности и биологии может всё чаще зависеть от специализированных механизмов управления.

Ключевые факты

  • Fable 5.1 и Mythos 5.1 используют одну и ту же базовую модель, но отличаются уровнями защиты и правилами доступа.
  • По оценке Anthropic, Fable 5.1 обходится на 25% дешевле при типичных нагрузках с оплатой по токенам, а экономия при использовании агентов может достигать примерно 45%.
  • Enterprise Frontier Safeguards позволит хранить защищённые данные в облачной инфраструктуре под управлением клиентов; поэтапное внедрение начнётся позднее осенью.
  • Как сообщается, обновлённые средства контроля кибербезопасности сокращают количество ложных срабатываний на 60% и позволяют находить уязвимости, по-прежнему запрещая разработку эксплойтов.
  • Как сообщается, в ходе тестирования раннего доступа удалось установить, что причиной многолетнего сбоя программного обеспечения, возникавшего в одном случае на миллион, был дефект в библиотеке внешнего поставщика.
Читать первоисточник

Полный текст — в первоисточнике. Здесь — краткое изложение и ключевые факты.

/ похожие материалы