Больше рассуждений, меньше ручной работы с новой Grok 4.6

В августе текущего года, чуть больше месяца спустя после Grok 4.5, компания SpaceXAI выпустила Grok 4.6. Такой темп обновлений сам по себе говорит о многом: вместо привычного цикла в несколько месяцев компания все чаще выпускает модели буквально одну за другой. При этом Grok 4.6 – отнюдь не новая модель с нуля, а результат более долгого дополнительного обучения поверх той же основы, что лежала в Grok 4.5. В SpaceXAI прямо говорят, что упор сделали на длительную самостоятельную работу агентов и на более амбициозные интерактивные и визуальные проекты, а не на очередной скачок общего интеллекта. Вместе с командой Креатор Проджект разберемся, в чем заключаются особенности данного обновления.

Как проходило дообучение

Разработчики продлили этап дополнительного обучения и добавили в него специально подобранные данные по рассуждению и сложным техническим темам, а также качественные инженерные примеры и обновленный алгоритм оптимизации. На этой базе заново собрали обучающие траектории для разных уровней рассуждения, разных агентных сценариев и разных областей, от STEM-дисциплин до программирования и работы со знаниями. Причем часть этой работы сделала сама предыдущая модель, Grok 4.5, а проблемные примеры отфильтровали автоматической проверкой. После этого модель прошла обучение с подкреплением на широком наборе агентных задач, в том числе оптимизацию низкоуровневого кода, веб-разработку и проектирование.

Отдельно стоит отметить, что один из главных партнеров по обучению, редактор кода Cursor, теперь принадлежит самой SpaceXAI: компания купила его за 60 миллиардов долларов. С одной стороны, это объясняет, почему модель так хорошо чувствует себя именно в задачах разработки внутри Cursor. С другой, ровно поэтому к бенчмаркам, где Cursor фигурирует в качестве среды тестирования, стоит относиться немного осторожнее: независимости в них уже меньше, чем могло бы быть.

Что она реально умеет лучше предыдущей версии

По собственному индексу интеллекта Artificial Analysis, объединяющему девять разных тестов, Grok 4.6 почти сравнялась с GPT 5.6 Sol и совсем немного отстала от Fable 5, при этом заметно оторвалась от собственного предшественника. Любопытно, что в чистом программировании модель не всегда лидирует и местами уступает и GPT, и Fable, зато именно в длинных агентных прогонах, когда нужно самостоятельно довести задачу до конца за много шагов, разрыв в ее пользу становится куда заметнее. В SpaceXAI отмечают, что модель стала чаще сама проверять и перепроверять промежуточный результат в ходе долгой работы, а не просто двигаться дальше по заданному плану.

В работе это заметнее всего в задачах наподобие сборки рабочего приложения с нуля по одному общему описанию. Модель сама разбирается в незнакомой предметной области, продумывает структуру будущего продукта, реализует основную логику. После этого дорабатывает результат по обратной связи. Первые версии визуальных и интерактивных проектов при этом получаются заметно более цельными, чем раньше. Модель сразу закладывает разумную структуру и визуальный язык, а не собирает их постепенно методом проб и ошибок.

Grok 4.6 почти догнал Fable. Источник: https://x.ai/news/grok-4-6

Доступ, цена и вопросы безопасности

Модель сразу доступна в Cursor и в собственном инструменте Grok Build, а также через API и через партнерские сервисы. Любопытно, что Grok 4.6 почти сразу появился и на платформе Google для корпоративных агентов под названием Gemini Enterprise. Для двух конкурирующих компаний это выглядит не самым очевидным шагом, но говорит о том, что SpaceXAI явно старается продать модель как можно шире, а не держать ее только внутри собственной экосистемы. Контекст у нее большой, около 500 тысяч токенов, на входе принимает текст и изображения, а на выходе выдает только текст. Цена начинается от 2 долларов за миллион входных токенов и 6 долларов за миллион выходных, у более быстрой версии модели она вдвое выше. В первую неделю после запуска компания увеличила лимиты использования в Grok Build и Cursor вдвое, чтобы желающие могли попробовать модель без лишних ограничений.

В SpaceXAI отдельно подчеркивают, что вместе с ростом возможностей модели расширили и проверку ее безопасности: провели самый широкий на сегодня набор тестов перед запуском и продолжили независимую проверку уже после релиза. Формулировка выглядит осторожной не просто так: у компании уже случались истории с неожиданным и явно нежелательным поведением прежних версий Grok, и нынешний акцент на проверках скорее ответ на этот опыт, чем формальность для галочки.

Пример генерации ответа

Выводы

Таким образом, Grok 4.6 выглядит скорее заметной доработкой предыдущей версии, чем полностью новым поколением модели. Главный прогресс пришелся на длительные агентные задачи и создание сложных интерактивных проектов, в которых модель стала значительно самостоятельнее и научилась аккуратнее доводить свою работу до качественного результата.

Если вы нашли ошибку, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter. Можете написать лучше? Мы всегда рады новым авторам.

Интересно? Поделиться:

Добавить комментарий

Оставляя комментарий вы соглашаетесь на обработку персональных данных в соответствии с политикой конфиденциальности, соглашаетесь с пользовательским соглашением. Ваш адрес email не будет опубликован. Обязательные поля помечены *

Рекомендуем почитать

Подпишитесь на нашу рассылку

Loading

Сообщить об опечатке

Текст, который будет отправлен нашим редакторам:

Продолжая использовать наш сайт, вы соглашаетесь с использованием файлов cookie. Они помогают нам обеспечивать корректную работу сайта и делать его более удобным.
Принять
Политика конфиденциальности