Содержание
Проверка ИИ-агентов на пользовательских задачах
Oqoqo позволяет создавать собственные оценки и закрытые бенчмарки для агентных задач из реальных сценариев. Эксперименты выполняются в управляемой облачной инфраструктуре. Каждая задача изолирована в собственной песочнице с необходимыми агенту файлами, инструментами и учётными данными.
Сравнение и разбор результатов
На одних и тех же задачах можно сравнивать нескольких агентов, модели и варианты обработки. Для проверки доступны подробные пошаговые траектории с вызовами инструментов, ошибками и точками отказа.
Показатели экспериментов
Платформа выявляет неэффективные траты токенов и затруднения при взаимодействии с интерфейсом, а также показывает изменение доли успешно выполненных задач между итерациями.







