Scala Digest. Выпуск 44


Привет, Хабр! Мы — Настя, Эвелина и Михаил — бэкенд-разработчики Т-Банка, пишем код на Scala и горим желанием его популяризировать. Мы собираем и агрегируем новости из разных источников, включая Scala Times, блог Petr Zapletal, добавляем дополнительные материалы и собственные комментарии. Мотивацию черпаем из желания развиваться и делиться полученными знаниями.
Всех поздравляем с наступившим сентябрем. Поздравьте учителей, переверните календарь — и вперед, читать наш дайджест!
Приветствуем любую обратную связь! (づ ◕‿◕ )づ

MVP - одно из самых заезженных слов в корпоративном лексиконе последних лет. Им называют что угодно: небольшой пилот, полнофункциональный продукт, огромный проект на два года, а иногда - даже финальный релиз, который просто не успели доделать. Единственное, чем это редко бывает - минимально жизнеспособным продуктом. То есть тем, чем MVP является по определению. И проблема здесь не в терминологии. Проблема в том, как принимаются решения о том, что попадёт в первый релиз.

Приветствуем, Хабр. У нас вышла долгожданная новинка, посвящённая методологии «SRE» — Site Reliability Engineering. Книга называется «SRE. Новый подход к управлению инфраструктурой». Написал эту книгу выдающийся инженер Павел Рудницкий, автор «Инфраструктурного блога», разработчик с 25-летним стажем, практиковавший DevOps, когда это ещё не было мейнстримом. Как многие из вас знают, искусство SRE зародилось в компании Google приблизительно в середине нулевых, суть его заключается в обеспечении бесперебойной работы сайтов и сервисов даже в условиях частичных отказов, текущего ремонта и в процессе выкатывания обновлений.

Для оценки эффективности ИИ уже давно и успешно используют самые разные бенчмарки. Берем модель/агента, выдаем им одинаковый набор задач, считаем долю успешных решений и получаем удобную цифру, по которой можно сравнивать системы между собой. По результатам используем ту, которая справилась с большим процентом задач. Звучит круто и даже удобно, но, как всегда, есть нюанс: все работает при условии, что сам экзамен составлен правильно. А с этим, как выясняется, бывают проблемы. Внутри бенчмарка могут оказаться некорректные эталонные ответы, противоречивые условия или правила оценки, которые засчитывают правильное решение как ошибку, и еще много всего, что исказит итоговый результат. Летом 2026 года исследователи провели независимый аудит четырех бенчмарков для агентов, работающих с внешними инструментами: BFCL v4, τ²-Bench, LiveMCPBench и MCP-Atlas. Эксперты вручную проверили 496 выполненных заданий и в 92 случаях (18,5%) не согласились с автоматической оценкой бенчмарка. Причины оказались разными: от жесткого сравнения с эталоном до нестабильной трактовки критериев самими LLM-судьями. Еще одно исследование IBM предлагает использовать LLM, чтобы проверять качество самих бенчмарков. Авторы работают с бенчмарками для task-oriented conversational agents — агентов, которые общаются с пользователем и выполняют конкретную задачу рамках заданных правил. Например, оформляют возврат в интернет-магазине или изменяют бронирование. Сегодня будем разбираться, что там наделали IBM и как так получилось, что у нас появляются бенчмарки для бенчмарков и почему в мире уже вовсю разворачивается мебиус-системы ИИ.

На выставке IFA 2026 в Берлине компания Acer представила семь новых мониторов серий Nitro и Predator с высокой частотой обновления для создателей контента и геймеров. Одна из моделей предлагает QD-OLED-дисплей с 10-битной глубиной цвета, остальные оснащены IPS- или VA-панелями с 8-битной глубиной цвета. Все новинки обеспечивают высокую контрастность благодаря технологии адаптивного управления контрастностью (ACM). Predator XB253Q U1. Источник изображений: Acer
Комментарии
Войдите, чтобы оставить комментарий.
Пока нет комментариев — станьте первым.