Главная / Технологии

Бенчмарки Мебиуса: зачем IBM учит ИИ проверять собственные вопросы

Технологии02.09.2026· 1 мин чтения
Бенчмарки Мебиуса: зачем IBM учит ИИ проверять собственные вопросы
Реклама

Для оценки эффективности ИИ уже давно и успешно используют самые разные бенчмарки. Берем модель/агента, выдаем им одинаковый набор задач, считаем долю успешных решений и получаем удобную цифру, по которой можно сравнивать системы между собой.

По результатам используем ту, которая справилась с большим процентом задач. Звучит круто и даже удобно, но, как всегда, есть нюанс: все работает при условии, что сам экзамен составлен правильно. А с этим, как выясняется, бывают проблемы.

Реклама

Внутри бенчмарка могут оказаться некорректные эталонные ответы, противоречивые условия или правила оценки, которые засчитывают правильное решение как ошибку, и еще много всего, что исказит итоговый результат.

Летом 2026 года исследователи провели независимый аудит четырех бенчмарков для агентов, работающих с внешними инструментами: BFCL v4, τ²-Bench, LiveMCPBench и MCP-Atlas. Эксперты вручную проверили 496 выполненных заданий и в 92 случаях (18,5%) не согласились с автоматической оценкой бенчмарка. Причины оказались разными: от жесткого сравнения с эталоном до нестабильной трактовки критериев самими LLM-судьями. 

Еще одно исследование IBM предлагает использовать LLM, чтобы проверять качество самих бенчмарков. Авторы работают с бенчмарками для task-oriented conversational agents — агентов, которые общаются с пользователем и выполняют конкретную задачу рамках заданных правил. Например, оформляют возврат в интернет-магазине или изменяют бронирование. 

Реклама

Сегодня будем разбираться, что там наделали IBM и как так получилось, что у нас появляются бенчмарки для бенчмарков и почему в мире уже вовсю разворачивается мебиус-системы ИИ.

Читать далее
Реклама
Похожие материалы
5 причин внедрить ИИ в клиентский сервис
Технологии
5 причин внедрить ИИ в клиентский сервис

Рост затрат на найм сотрудников, постоянно выгоревшая команда, текучка, падение лояльности клиентов и просадка в выручке — это только часть последствий, с которыми сталкиваются компании без автоматизации и ИИ в поддержке. Пока одна часть рынка экспериментирует и осваивает гибридные модели поддержки, другая продолжает «тушить пожары» старыми методами. Но ведь никому не нравится быть догоняющим? В этой статье раскроем 5 причин, почему ИИ стоит внедрить в клиентский сервис уже сейчас.

02.09.2026 · 1 мин
От Root CA до User Authorization в nginx+apache. Часть 4. Свой web-УЦ: выпуск из браузера, роли и аудит
Технологии
От Root CA до User Authorization в nginx+apache. Часть 4. Свой web-УЦ: выпуск из браузера, роли и аудит

Четвёртая часть цикла про свой удостоверяющий центр. В первой мы развернули Root CA и три промежуточных центра, во второй научились отзывать сертификаты и подняли OCSP-responder, в третьей настроили вход по клиентскому сертификату в nginx и Apache. Осталось ответить на вопрос, который возникает сразу после первого успешного входа: а откуда у людей берутся сертификаты? Пока удостоверяющим центром пользуется один человек, openssl в терминале — идеальный интерфейс. Как только приходит второй с просьбой «выпусти мне тоже», начинается то, ради чего существуют регистрационные центры: заявки, роли, журнал и ответ на вопрос «кто и на каком основании это подписал». В четвёртой части: — PKCS#10 прямо в браузере. Ключ рождается в WebCrypto и не покидает его, запрос собирается на голом JavaScript без единой библиотеки, а результат проверяется настоящим openssl, а не «на глаз». — Почему кнопке «получить сертификат» нельзя доверять отличительное имя: позволь заявителю назвать себя самому — и он выпишет себе сертификат с DN администратора. Настоящий, подписанный вашим же центром. — PKIDesk: движок управления сертификатами на Go, без единой зависимости, под Apache-2.0. Разрезан по границе доверия — у веб-части нет ни ключей УЦ, ни index.txt, ни даже бинарника openssl. Плюс пять архитектурных развилок, за которые придётся отвечать перед аудитом. — Три дефекта, которые вылезли только на живом стенде: правило subjectAltName = supplied, которое не выполнится никогда; просроченный сертификат, который остаётся действующим и занимает subject; гонка «выпустил — сразу зашёл», где nginx запоминает неудачную проверку отзыва. — Четыре расширенных справочника, 237 параметров: openssl req, openssl genpkey, структура PKCS#10 и Web Crypto API — синтаксис, значения, умолчания и подводные камни, сверенные с официальной документацией.

02.09.2026 · 1 мин
Как установить контакт с инопланетянами с помощью LLM
Технологии
Как установить контакт с инопланетянами с помощью LLM

Допустим, в один прекрасный день земные радиотелескопы начнут принимать сигналы радиовещания инопланетян (мощные и незашифрованные, конечно). Как нам понять о чем там речь?

02.09.2026 · 1 мин
Турнир семи нейросетей: участники судили друг друга, а финал решили 3360 битв
Технологии
Турнир семи нейросетей: участники судили друг друга, а финал решили 3360 битв

После первой статьи я понял, что мои велосипеды кому-то полезны. Поэтому рассказываю про следующий. Я делаю сайты с помощью нейросетей. И меня давно бесило, что внятного сравнения моделей на наших просторах нет: либо синтетические бенчмарки, где кто-то решает олимпиадные задачи, либо «топ-10 нейросетей 2026» с картинками из стока. Мне нужно было другое — какая модель с первого промпта выдаст результат, который не стыдно показать заказчику. Внятного сравнения я не нашёл. В наше время «такого ещё нет» — это не отказ, а техническое задание: не нашёл — сделай сам. С GTA 6 у меня этот принцип пока не сработал, а вот со сравнением моделей — вполне. Собрал команду: GPT и Claude — старые, добрые, проверенные: подписка не жалуется на переработки; остальных подключил через OpenRouter. Получилось семь участников:

02.09.2026 · 1 мин

Комментарии

Войдите, чтобы оставить комментарий.

Пока нет комментариев — станьте первым.

Реклама