Что изменилось в новой флагманской модели Anthropic Claude Opus 4.8

В мае 2026 года компания Anthropic обновила флагманскую модель Opus до версии 4.8. И на первый взгляд, этот апдейт не несет в себе особых новшеств. Та же цена, чуть лучше цифры в бенчмарках. Однако за формулировкой «улучшения по всем показателям» прячется история о том, как компания пыталась сделать модель более здравомыслящей и честной, не растеряв ее деловую хватку. Без потерь, впрочем, не обошлось.

Что нового предложили разработчики

Модель доступна через API под именем claude-opus-4-8, цена осталась прежней (5 долларов за миллион входящих токенов, 25 – за выходные; при этом быстрый режим стал более дешевым). В Claude.ai и Cowork появился ползунок «усилий». Чем выше его значение, тем дольше и глубже думает модель. Однако при этом лимит, конечно, расходуется в данном случае быстрее.

Обновленная модель Claude Code умеет сама планировать работу, запускать сотни параллельных субагентов. Нейросеть проверяет результат перед тем, как отчитаться. В таком режиме нейросеть способна самостоятельно провести миграцию кодовой базы на сотни тысяч строк, от старта до готового результата.

Claude Opus 4.8 показывает лучшие результаты в большинстве тестов. Источник: https://www.anthropic.com/news/claude-opus-4-8

Честность против деловой хватки

Первые впечатления пользователей были смешанными. В первый день многие жаловались на многословность и академическую сухость, будто модель нарочно спорила с любым утверждением, лишь бы не показаться подхалимом. Через день-два ощущение сгладилось.

Один пользователь заметил: со старыми моделями работал пошаговый разбор по пунктам, а с 4.8 такой подход буксует. Модель переусердствует и жжет токены там, где хватило бы обозначить цель и отпустить ее работать самостоятельно. Особенно это заметно при написании скилов для самой Claude – формулировать задачу для скила модель умеет лучше автора. Цифры подтверждают: Opus 4.8 – первая модель линейки, ни разу не выдавшая ложные числа в тесте на некритичную отчетность о результатах, а в задаче на поиск ошибки по нескольким файлам отработала без единой промашки. Что касается прежней версии, то она ошибалась в четверти случаев. Также модель примерно вчетверо реже пропускает недочеты в собственном коде, не комментируя их.

Уровень несогласованного поведения по моделям. Источник: https://www.anthropic.com/news/claude-opus-4-8

Обратная сторона осторожности

У этой честности есть цена, и Anthropic ее не скрывает. Claude стала более склонна к избыточно развернутым отказам; тут-то и проявилась оборотная сторона добросовестности. Устойчивость к промпт-инъекциям без дополнительной защиты тоже слегка просела: доля успешных атак на профильном бенчмарке выросла с 6 до 9,5 %, хотя штатные защитные механизмы возвращают показатель на прежний уровень. Для тех, кто строит агентов через API, есть нюанс: на тесте использования браузера атаки пробивали голую модель почти в трети случаев, а с защитой Anthropic – лишь в долях процента. Безопасность оказывается не свойством самой модели, а результатом работы обвязки вокруг нее.

Нагляднее всего компромисс виден в симуляции под названием «Vending-Bench 2» от Andon Labs: модели выдают 500 стартовых долларов и год на управление вендинговым бизнесом. На максимальном режиме Opus 4.8 закончил год с 2992 долларами против почти 11 тыс. у предшественника – около четверти прежнего результата. Причина прозаична: у прежней версии было отдельное обучение деловым навыкам и противостоянию манипуляциям других агентов, но именно оно подталкивало модель к нечестности, и в 4.8 его убрали. Модель стала честнее, но заодно легче обманываемой и слабее в переговорах.

Где Anthropic видит следующий шаг

При этом сама компания описывает 4.8 довольно сдержанно. В Anthropic называют обновление «скромным, но ощутимым» улучшением по сравнению с предыдущей версией и отдельно признают, что работа над снижением стоимости таких возможностей еще продолжается. То есть ставка сделана не только на дальнейшее наращивание интеллекта: следующая проблема – сделать сопоставимые с Opus возможности доступными дешевле.

Одновременно компания готовит следующий, уже более высокий класс моделей. В рамках проекта «Project Glasswing» отдельные организации тестируют Claude Mythos Preview для задач кибербезопасности. Но Anthropic пока не собирается выпускать такие системы массово: модели этого уровня, по оценке самой компании, требуют более сильных защитных механизмов. Таким образом, развитие линейки упирается уже не просто в вопрос «насколько умнее сделать модель», а в то, насколько безопасно дать ей возможность действовать самостоятельно в чувствительных областях.

Заключение

Как подчеркивают эксперты Креатор Проджект, Claude Opus 4.8 интересен именно тем, что его нельзя однозначно назвать улучшением по принципу «новая версия просто лучше старой». Когда от модели требуется проверить собственную работу или не выдавать неподтвержденный результат за факт, прогресс выглядит убедительно. Но в автономной работе, особенно там, где нужны переговоры, сопротивление манипуляциям и самостоятельное принятие коммерческих решений, улучшение оказалось неоднозначным.

Поэтому главное изменение в Opus 4.8 – скорее смена приоритетов, чем очередной рывок в бенчмарках. Anthropic сознательно поставила надежность и честность выше части прежней деловой хватки, а затем начала строить вокруг модели инструменты, позволяющие управлять глубиной рассуждений и безопасностью. В результате 4.8 лучше показывает себя там, где модель должна быть аккуратным исполнителем, но пока требует большей осторожности там, где ей предлагают полностью заменить человека. И, судя по планам Anthropic, следующий этап гонки будет проходить уже не только за интеллект, но и за способ его безопасного применения.

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter. Можете написать лучше? Мы всегда рады новым авторам.

Интересно? Поделиться:

2 комментария к “Что изменилось в новой флагманской модели Anthropic Claude Opus 4.8

  1. Anthropic на мой взгляд движется в правильном направлении. Opus 4.8 не произвёл революцию, но эволюцию сделал уверенно. Для задач где важна надёжность (анализ данных, стратегическое планирование) Opus 4.8 однозначный шаг вперёд. Для сценариев где нужен быстрый результат (например, генерация черновиков) возможно стоит остаться на предыдущей версии. Лично я готов пожертвовать парой лишних минут ожидания чтобы получить обоснованный честный ответ, а не красивую ложь.

  2. Я согласен с разработчиками ,надо больше времени уделять за способ его безопасного применения.

Добавить комментарий

Оставляя комментарий вы соглашаетесь на обработку персональных данных в соответствии с политикой конфиденциальности, соглашаетесь с пользовательским соглашением. Ваш адрес email не будет опубликован. Обязательные поля помечены *

Рекомендуем почитать

Подпишитесь на нашу рассылку

Loading

Сообщить об опечатке

Текст, который будет отправлен нашим редакторам:

Продолжая использовать наш сайт, вы соглашаетесь с использованием файлов cookie. Они помогают нам обеспечивать корректную работу сайта и делать его более удобным.
Принять
Политика конфиденциальности