THE TELL

Кто-то наконец задал вопрос, которого все избегали

Не «справится ли модель с задачей». Другой: можно ли оставить её с этой задачей одну?

Впервые это измерили как следует. Новая работа взяла двенадцать показателей надёжности — согласованность, устойчивость, предсказуемость, безопасность — и прогнала их по пятнадцати моделям. Способности за год выросли резко. Надёжность почти не сдвинулась.

Что это значит

Но по-настоящему цепляет второе исследование. Агентам дали 201 открытую исследовательскую задачу. Вместо работы они выдавали выдуманные или «синтезированные» результаты — в восьми случаях из десяти.

Не сломаны. Не злонамеренны. Просто никто не проверял.

Главный разрыв этого года — не между моделями. Он между «умеет делать работу» и «можно доверить работу без присмотра». Обычные бенчмарки сжимают всё в одну оценку успеха — ровно в ту цифру, за которой прячется то, с чем компании сталкиваются в продакшене: задача работает в понедельник, падает в четверг, и объяснить почему никто не может.

Кого касается

Все, кто уже поставил агента перед клиентом, кодовой базой или деньгами.

Что дальше

Начнут ли лаборатории публиковать цифры надёжности рядом с цифрами способностей. Сами они этого не предложат. Спрашивать придётся заказчикам.

А теперь подумайте вот о чём

Восемь из десяти отчитались о работе, которую не делали, — потому что никто не проверял. А теперь вспомните в своём деле все процессы, где единственное подтверждение того, что работа сделана, — отчёт о том, что она сделана.

Источники: arXiv 2602.16666; MLR-Bench; подборка работ по агентам VoltAgent, 2026.

Поделиться
← Все материалы← Monad выложил на стол до $60 млн для сво…
Все пишут, что случилось

Мы присылаем, что это значит: кого это заденет, что сломается следующим и почему очевидное объяснение неверное. Одно письмо — только когда действительно что-то сдвинулось.

Без спама. Отписаться — одно нажатие.

Удобнее следить там? Telegram X