Claude Opus 5: модель, которая исправляет собственные ошибки

Полный перевод X Article о Claude Opus 5, проверке собственной работы, бенчмарках, safety и практических промптах.

Claude Opus 5: модель, которая исправляет собственные ошибки

Источник: https://x.com/soboozie/status/2080776798711747013

Автор: boozie

Модели дают чертёж детали машины. Её просят восстановить как рабочую 3D-модель. Один нюанс: модели не разрешено фактически видеть сам чертёж.

Все остальные модели в такой постановке провалились. По пять попыток у каждой. Ноль решений.

Claude Opus 5 написал собственный пайплайн компьютерного зрения, вытащил геометрию из сырых пикселей и восстановил деталь. Потом сделал это снова. И снова.

Это не балл в бенчмарке. Это модель, которая отказывается принимать «я не могу» как ответ.

Сохраните это. Вот всё важное про Opus 5 — и почему настоящая история не в цифрах, а в том, что модель делает, когда никто не объяснил ей как.

До бенчмарков: что на самом деле произошло

Anthropic выпустила Claude Opus 5 24 июля 2026 года, примерно через два месяца после предыдущего обновления Opus. Ритм тот же, что обычно. Результат — другой.

Opus 5 приближается к frontier-интеллекту Claude Fable 5, топовой модели Anthropic, за половину цены. Те же $5 за миллион входных токенов и $25 за миллион выходных токенов, что и у предшественника Opus 4.8. Без повышения цены. Просто намного более умная модель на старом ценнике.

Теперь это модель по умолчанию в Claude Max и самая сильная модель, доступная в Claude Pro.

Это поверхностная история. Интересное — под ней.

Цифры, коротко

На Frontier-Bench v0.1, оценке для программирования и knowledge work, Opus 5 обходит все остальные модели на рынке и более чем удваивает собственный результат Opus 4.8 при меньшей стоимости за задачу.

На CursorBench 3.2 при максимальном effort она оказывается в пределах половины процентного пункта от лучшего результата Fable 5. За половину цены.

На ARC-AGI 3, бенчмарке задач, которых модель раньше не видела, Opus 5 набирает в три раза больше следующей лучшей модели.

На OSWorld 2.0, который проверяет, насколько хорошо модель реально управляет компьютером — нажимает кнопки, заполняет формы, перемещается по софту, — Opus 5 побеждает все модели во всех ценовых категориях и обходит лучший результат Fable 5 примерно за треть стоимости.

На Zapier AutomationBench, который измеряет, может ли модель провести бизнес-задачу от начала до конца, pass rate Opus 5 примерно в 1,5 раза выше следующей лучшей модели при той же стоимости.

Это ещё и реальный шаг вперёд в научной работе. Opus 5 обходит Opus 4.8 во всех life-sciences оценках Anthropic. Самые большие скачки: плюс 10,2 процентного пункта в выводе молекулярных структур по спектроскопическим данным и плюс 7,7 пункта в предсказании того, как изменение последовательности белка влияет на его функцию.

Хорошие результаты. У каждой новой модели хорошие результаты. Вот что действительно другое.

Часть, после которой стоит выпрямиться

На секунду забудьте историю с FreeCAD. Вот ещё две.

Anthropic дала Opus 5 настоящий живой баг в популярном open-source пакетном менеджере. Не синтетический тест. Реальный баг, с которым реально разбирались мейнтейнеры.

Opus 5 не просто залатал симптом. Он нашёл первопричину и исправил edge case, который пропустил патч сообщества, написанный людьми. Конкурирующая модель, получив тот же баг, исправила только видимый симптом и уверенно сообщила, что проблема решена.

Она не была решена. Opus 5 это понял. Другая модель не проверила.

Третья история: инженер в трейдинговой фирме попросил Opus 5 собрать feed рыночных данных для совершенно новой биржи за одну сессию. Предыдущие модели вообще не могли закончить эту задачу, даже когда им давали подробные планы. Живого feed для тестирования не было, поэтому Opus 5 сначала построил собственный test harness, чтобы проверить, что его код правильно парсит данные биржи, и только потом счёл работу завершённой.

Никто не просил его строить test harness. Он сам решил, что без этого задача не закончена.

Вот настоящий заголовок. Не «модель стала умнее». А модель, которая проверяет собственную работу, ловит то, что сама упустила, и не останавливается на «выглядит готовым».

Она не просто делает то, что вы просите. Она спорит в ответ.

Об этом почти никто не пишет.

Marquis Wang, principal AI engineer у партнёра раннего доступа, описал сессию по реархитектуре, где он предложил дизайн. Opus 5 возразил. Он настоял. Модель не уступила.

Вместо этого она точно объяснила, что было ценного в исходной идее, сузила возражение до одного конкретного вопроса дизайна и предложила компромисс, который сохранял сильную часть идеи и исправлял найденный изъян.

«Именно такой уровень суждения позволяет нам доверять ей с меньшим надзором», — сказал он.

Это не чатбот, который со всем соглашается. Это модель, которая воспринимает «пользователь так сказал» как отправную точку, а не как окончательный ответ, и удерживает позицию, когда действительно права.

Та же закономерность видна в code review. Zimu Li, technical staff member, сказал, что при передаче pull request Opus 5 «не спешит публиковать: проверяет ветки, проверяет шаблон и продумывает последствия для тестов». Старые модели, отметил он, чаще забегали вперёд и спотыкались о проверки.

Neeraj Deshmukh, engineering director, использующий её в продакшене, описал её diff'ы как чистые и компактные, без мёртвого кода, и назвал модель «более сильным обнаружителем рисков в тонких, специфичных для кодовой базы проблемах».

А Igor Ostrovsky, CTO компании, строящей agent platform, сказал прямо: «Я уверен, что для code review мы бы предпочли, чтобы люди использовали Opus 5, а не Opus 4.8».

Осторожный учёный

Alfredo Andere, который запускает workflow геномного анализа, сказал, что Opus 5 «ведёт себя больше как осторожный учёный, чем любая модель, которую мы запускали». Она сама выбирает правильные статистические тесты, чтобы исключить confounders, перепроверяет собственные результаты независимыми методами и сохраняет фокус в длинных многошаговых анализах без дрейфа.

Это совпадает с цифрами бенчмарков: самые большие скачки относительно Opus 4.8 в life-sciences оценках как раз в областях, которые наказывают небрежное, непроверенное рассуждение — например, корректный вывод молекулярной структуры из сырых спектроскопических данных вместо pattern matching к чему-то знакомому.

Она ещё и просто умеет строить вещи

На секунду отложим историю с верификацией. Opus 5 также с большим отрывом лучшая креативная и визуальная модель, которую Anthropic выпускала под именем Opus.

Madhav Jha, CTO full-stack app builder, назвал её «самым большим скачком в семействе Opus со времён 4.5» и сказал, что на фронтенде это видно первым: лучшие анимации, игры и 3D-работы, которые они видели от модели Opus.

Демо самой Anthropic это подтверждают. Opus 5 построил интерактивную аэродинамическую трубу, которая в реальном времени визуализирует поток воздуха вокруг аэродинамических и неаэродинамических объектов, а также рабочую интерактивную иллюстрацию клетки, где можно изучать её внутренние структуры. Это не статичные картинки. Это вещи, по которым можно кликать и которыми можно управлять.

Alex Wang, работающий над генерацией презентаций, сказал, что самые большие улучшения видны в задачах с длинным горизонтом: собрать полный deck, а затем переработать его по обратной связи. «Качество artifact определяет, какую модель мы shipping», — сказал он, — «и это самый ясный шаг вперёд, который мы видели».

Регулятор effort: новый рычаг стоимости

Opus 5 выходит с настройкой effort: low, medium, high и max. Вы выбираете, насколько сильно модель думает перед ответом.

Это не косметика. На Zapier AutomationBench даже минимальный effort у Opus 5 проходит больше задач, чем любая другая модель на любых настройках. Это означает, что для большой доли реальной работы вам не нужен max effort: вам нужна дешёвая настройка, и она всё равно выигрывает.

Сохраняйте max effort для задач, которые действительно сложны: многошаговое agentic coding, long-horizon research, всё, где ошибка стоит дороже, чем дополнительные токены.

Ошибка, которую большинство сделает в первый месяц: оставит всё на max по умолчанию и будет удивляться, почему счёт выглядит как у Fable 5. Относитесь к effort как к регулятору, а не как к дефолту.

4 промпта, которые действительно используют отличие Opus 5

Это не общие промпты в стиле «напиши мне функцию». Они сделаны так, чтобы включать поведение проверки и суждения, из-за которого Opus 5 отличается.

Промпт 1: задача без аварийного выхода

«Вот [спецификация, сломанный репозиторий, design file]. Заверши задачу полностью. Прежде чем сказать, что всё готово, проверь себя: запусти, протестируй или сверяй с исходным требованием. Покажи, что ты проверил и что обнаружил, а не только финальный ответ».

Промпт 2: принудительный поиск первопричины

«Исправь этот баг. Прежде чем писать фикс, скажи, что ты считаешь первопричиной, отдельно от симптома, о котором я сообщаю. Если твой фикс исправляет только симптом, скажи об этом явно и объясни почему».

Промпт 3: запрос на возражение

«Вот мой подход к [проблеме]. Не просто реализуй его. Если видишь изъян, скажи конкретно, в чём он, и предложи компромисс, который сохраняет хорошее в моём подходе. Полностью соглашайся со мной только если действительно считаешь, что я прав».

Промпт 4: передача длинной задачи

«Возьми эту кодовую базу и эту цель. Пройди задачу от начала до конца. Перед тем как вернуть результат, проверь свой вывод так, как senior engineer проверял бы PR junior'а: корректность, edge cases и всё, что ты отметил бы на review».

Каждый из них опирается на одно и то же: Opus 5 не нужно отдельно учить проверять работу или возражать, но если назвать это явно, вы получаете след того, что она проверила и почему. А это важно, когда подписываетесь под результатом вы.

Alignment, безопасность и где модель всё ещё уступает

Opus 5 не самая сильная модель во всём. Anthropic говорит об этом прямо: она всё ещё уступает Mythos 5, safety-focused frontier-модели Anthropic, в задачах кибербезопасности, особенно в разработке эксплойтов, а не в обнаружении уязвимостей. Уязвимости она находит почти так же хорошо, как Mythos 5. Но заметно хуже превращает их в рабочие эксплойты, и этот разрыв намеренный: Anthropic сознательно не обучала Opus 5 на cyber-offense задачах.

Из-за этого cyber-классификаторы Opus 5 пропорционально менее ограничительные, чем у Fable 5, и блокируют примерно на 85% меньше запросов. Модели разрешено находить уязвимости в исходном коде, но запрещены binary-based vulnerability scanning, penetration testing и генерация эксплойтов. Предприятия и исследователи, уже участвующие в Anthropic Cyber Verification Program, получают версию с меньшими ограничениями для легитимной security work.

В биологии Opus 5 теперь самая способная общедоступная исследовательская модель Anthropic, а биологические запросы, которые блокируются на Fable 5, теперь маршрутизируются в Opus 5 вместо старой Opus 4.8.

Если говорить именно об alignment, Opus 5 — лучшая модель Anthropic на сегодня. В автоматизированных поведенческих аудитах перед деплоем она набрала 2,3 по общей misaligned behavior — самый низкий показатель среди недавних моделей Claude, лучше Opus 4.8, Sonnet 5 и даже Fable 5. Она показывает самый низкий уровень deceptive behavior в группе, меньше всего подвержена обману для misuse и безопаснее всех избегает безрассудных действий с труднообратимыми последствиями.

Как этим пользоваться

Chat: claude.ai, уже доступно, самая сильная модель на Claude Pro, дефолт на Claude Max.

API: claude-opus-5, та же цена, что у Opus 4.8: $5/M input, $25/M output.

Fast mode: работает примерно в 2,5 раза быстрее дефолтного режима, за двойную цену. Имеет смысл, когда latency важнее стоимости.

Automatic fallbacks (beta): если запрос срабатывает на safety-классификаторах Opus 5, теперь можно настроить автоматическую маршрутизацию в другую модель вместо простой блокировки. Вы получаете ответ, а не тупик.

Mid-conversation tool changes (beta): теперь можно менять набор инструментов, доступных Claude, посреди разговора без инвалидирования prompt cache — полезно для длинных agentic-сессий, которые переходят между фазами задачи.

Что это на самом деле значит

Гонка frontier-моделей в основном была историей о том, кто в этом месяце набрал больше на leaderboard. Эта история быстро устаревает, потому что в следующем месяце кто-нибудь другой возглавляет таблицу.

Более долговечная история Opus 5 — поведенческая: модель, которая, столкнувшись с «я не могу это проверить», всё равно строит инструмент для проверки; и модель, которая скажет, что в вашем плане есть изъян, вместо того чтобы молча построить flawed version. Ни одно из этих качеств не выглядит как одно число в бенчмарке. Они проявляются как меньшее количество сообщений в Slack в 2 часа ночи о коде, который «AI сказал, что протестировал».

Если вы решаете, стоит ли переключаться: не доверяйте leaderboard, доверяйте своей самой сложной задаче. Дайте Opus 5 то, на чём сломались три предыдущие модели, задачу без чистого условия успеха, и посмотрите, остановится ли она — или построит собственный путь через проблему.

Какая задача ломала каждую модель, которую вы пробовали до сих пор? Вот её и стоит тестировать на Opus 5.

Subscribe to Temperature 0.7 - AI блог об AI и роботах

Don’t miss out on the latest issues. Sign up now to get access to the library of members-only issues.
jamie@example.com
Subscribe