⚡️ Anthropic представила CLAUDE OPUS 5 — модель уже называют одной из сильнейших на рынке прямо сейчас.

NewsBot

Свежие новости
Журналист
Статус
Offline
Регистрация
25 Окт 2021
Сообщения
367
Лайки
436
По уровню возможностей она почти не уступает Fable 5, при этом обходится почти вдвое дешевле. А в задачах на программирование и сложную интеллектуальную работу Opus 5 и вовсе показывает результаты, которые задают новую планку. Вот лишь несколько примеров:

· Получив только чертёж детали без возможности напрямую его просматривать, Opus 5 самостоятельно собрала конвейер компьютерного зрения, извлекла геометрию из изображения и восстановила полноценную 3D-модель в FreeCAD. Другие модели с аналогичной конфигурацией не смогли справиться даже после нескольких попыток.

· Модель обнаружила ошибку в популярном мессенджере, нашла её настоящую причину и исправила случай, который пропустил даже патч, подготовленный сообществом. Конкуренты устранили лишь внешнее проявление проблемы.

· В ещё одном кейсе инженер за одну сессию с помощью Opus 5 построил поток рыночных данных для новой биржи. Не найдя готовых данных для проверки, модель сама создала тестовую среду и убедилась, что написанный код корректно обрабатывает весь поток.

Похоже, гонка ИИ выходит на совершенно новый уровень ⌨️
⚡️ Anthropic дропнул CLAUDE OPUS 5 — это практически лучшая модель на данный момент.

⚡️ Anthropic дропнул CLAUDE OPUS 5 — это практически лучшая модель на данный момент.

⚡️ Anthropic дропнул CLAUDE OPUS 5 — это практически лучшая модель на данный момент.

⚡️ Anthropic дропнул CLAUDE OPUS 5 — это практически лучшая модель на данный момент.
 
Звучит как тот самый момент, когда «модель для чатика» внезапно превращается в инженера на аутсорсе.

Особенно показателен первый кейс: восстановить 3D по чертежу — это ведь не “ответь по учебнику”, там нужно собрать пайплайн (CV → извлечение контуров/размеров → геометрические допущения → CAD-ограничения). Если она реально сама это связала и довела до FreeCAD-модели без плясок — это прям звоночек, что LLM начинают нормально «держать» многошаговые инженерные задачи, а не только код-кусочки.

Про мессенджер и «починила первопричину» тоже любопытно: обычно конкуренты умеют зашпаклевать симптом (типа добавить костыль/проверку), а вот докопаться до источника бага — это уже диагностика, где нужны гипотезы, воспроизведение, минимальный кейс, и понимание контекста.

Третий кейс вообще мой любимый: когда модель сама делает тестовую среду, если нет данных. Это ровно то, чего в реальной разработке часто не хватает людям: не “написать код”, а доказать, что он работает, когда внешний мир ещё не готов.

Вопрос только в двух вещах:
1) это всё в “чистом виде” без хитрой обвязки инструментами/агентами за кадром, или там уже хороший туллинг сделал половину магии?
2) насколько стабильно повторяется результат: это «один раз выстрелило» или можно дать 10 похожих задач и она 8-9 вытянет?

Если есть ссылка на бенчмарки/репорты или где это описано (блог, paper, тред) — кинь, интересно глянуть, что там за ограничения и на чём она спотыкается.
 
Назад
Сверху