Агенты выполнили задачу. Почему тест всё равно провален?


Допустим, у тебя есть несколько AI-агентов. Один разбирает тикет, второй меняет код, третий запускает тесты, четвёртый готовит релиз.
Задача закрыта, тесты зелёные, артефакт собран. Метрика success_rate показывает успех.
Можно праздновать?
Не обязательно. Агенты могли несколько раз выполнить одну работу, нарушить порядок операций, одновременно захватить общий ресурс или случайно добиться правильного результата через недопустимую последовательность действий.
Финальное состояние корректное. Процесс — нет.
Именно эту проблему пытается измерить CoCoBench — новый бенчмарк для проверки координации нескольких AI-агентов. Его разработали исследователи из Нанкинского университета, Tsinghua и AgiBot.
Главная идея исследования полезна далеко за пределами робототехники:

Я хочу рассказать историю об одном эксперименте, длившемся 10 лет, затронувшем тысячи игроков и приведшем к возникновению небольшого, но сплоченного сообщества единомышленников, шагнувшего далеко за пределы обычных игровых сессий по вечерам после работы.

Подробное решение задания, в котором есть многие техники обфускации. Каждую технику я снял и рассказал как. Есть решение этого таска по трассировке. Я решаю иначе: снимаю обфускацию слой за слоем, чтобы на каждом шаге оставалась работающая декомпиляция. Читать далее

В прошлой статье (ссылка) я разобрал конвейер между агентом и клиентом: теги, регулярки, абзацы по 180 символов. Осталось два больших пояснения - что происходит со сделкой в amoCRM, когда диалог дошёл до неё, и стоп-кран, которым человек перехватывает диалог у бота. Поэтому сегодня показываю два Salesbot’а, которые замыкают контур: "Раздатчик" (диспетчеризация задач менеджерам) и "Идентификатор" (оцифровка старой базы). Хочу начать с вопроса, который оставался за кадром всех предыдущих статей. Нода IF: Is New User? в начале ветки проверяет Redis-ключ связки: пустой - значит клиент новый, запускаем синхронизацию со сделкой. А если клиент старый - заведён в CRM руками за год до внедрения ИИ? Если к примеру как в данном проекте, из-за внутренних решений касательно бизнес логики у заказчика сделки хранятся до последнего момента, наверное пока их не наступит больше чем за 30000 штук (P.S. про это я позже расскажу чуть позже - точнее про то КАК это ломает работу воркфлоу)? У него связки тоже нет. Формально он выглядит как новый. Обычная система в этот момент создаёт вторую сделку на первого же старого клиента, который написал ночью. Дубль. Добро пожаловать в слепую зону. Читать далее
![[Перевод] Исследование Марса человеком: Базовая проектная архитектура 5.0](/uploads/e81600a54df9da8db22e8241.png)
Пройдет еще десятилетие, и дети, которые пошли в сентябре 2026 в школу, будут выбирать профессии вроде "удаленный оператор лунного/марсианского робота", ведь в ближайшие десятилетия в лунно-марсианский проект (точнее, гонку, поскольку это будет несколько конкурирующих проектов пилотируемых миссий и строительства баз) будут вовлечены все страны мира, которые смогут себе это позволить... @avshkol взялся за перевод и выкладывает в этом посте главы и комментарии к "Human Exploration of Mars: Design Reference Architecture 5.0" - последнего (от 2009 года) из доступных в сети комплексного доклада NASA о способах и технологиях реализации обитаемой базы на Марсе. Этот документ описывает результаты изучения большими группами ученых и инженеров всех технических моментов освоения и изучения землянами Марса. Подобные документы скоро станут даже не учебниками, а базовыми текстами для введения в специальность для многих землян, выбирающих работу в начинающей рокит-расширение и стремительную экспансию во все сферы нашей жизни "дальнекосмической" отрасли. Читать далее
Комментарии
Войдите, чтобы оставить комментарий.
Пока нет комментариев — станьте первым.