· Хабр

Как тестировать и выбирать LLM под прикладные рабочие задачи

Руководитель проектов по внедрению систем на базе ИИ описал подход к тестированию языковых моделей на реальных рабочих задачах. Автор отмечает, что публичных бенчмарков недостаточно, поэтому для оценки работы с кодом и сложными документами необходимы собственные критерии приёмки.

Читать в первоисточнике — Хабр ↗

Ещё в ленте

· Хабр · Продукты · Железо

Эвотор оснастил терминал EvoPoint нейросетью для распознавания заказов по голосу

Компания Эвотор разработала платежный терминал EvoPoint с голосовым интерфейсом на базе нейросети. Решение предназначено для распознавания команд и заказов клиентов в условиях сильного шума кофемашин и торгового зала. Технология направлена на изменение процесса покупки и взаимодействия с устройством.

· Хабр · Модели · Исследования

Проблема согласованных ошибок в коде и тестах от ИИ-агентов

При генерации кода и тестов ИИ-агент может перенести одинаковые ошибки в обе части, из-за чего некорректный патч успешно проходит проверки. Непонимание исходных требований сохраняется на всех этапах работы модели. Впоследствии это усложняет отладку, так как исправление реализации приводит к падению зависимых тестов.

· Хабр · Бизнес · Продукты

Опыт автоматизации проверки товаров с помощью Jev вместо стандартных LLM

Интернет-магазин компьютерной техники использовал решение Jev для автоматической проверки новых товаров. Это позволило устранить бэклог из 100 тысяч заявок и сократить бюджетные расходы на 90% по сравнению со стандартными LLM.

· Хабр · Модели

Разбор модели Jev: что известно о новой ИИ-системе

В материале рассматривается модель Jev, вызвавшая активные обсуждения в сообществе специалистов по ИИ. Автор разбирает возможности новой системы, решаемые ею задачи и основания для перевода рабочих процессов на это решение.