Воспроизводимый agent evaluation · MIT + CC BY 4.0

Гейт релиза ИИ-агента

Сравните новую версию агента с baseline для каждого сценария. Fixture проверяет завершение задачи, правила вызова инструментов, порядок, ссылки и лимиты выполнения без обращения к модели или внешнему API.

Candidate намеренно проваливает проверки: так fixture демонстрирует механику gate. Результат ничего не говорит о качестве модели, реальной задержке, стоимости production, покрытии dataset или калибровке judge.
Шесть синтетических сценариев ИИ-агента: один пройден, семь новых ошибок, релиз заблокирован

Файлы

Контракт для сценария

Каждый сценарий задаёт свои инструменты, запрещённые действия, порядок, источники и лимиты. Универсального проходного балла нет.

Проверка регрессий

Старые ошибки остаются в отчёте. Релиз блокируют только новые нарушения с настроенной критической или серьёзной важностью.

Проверяемый результат

Manifest сохраняет все причины в стабильном порядке. JSON и SVG побайтно совпадают с результатом повторного запуска.

Что проверено

Девятнадцать tests покрывают все коды ошибок, некорректные policy, дубликаты, стабильный порядок, сравнение с baseline, сохранённые JSON и SVG, лицензии и credential или direct-PII patterns. В fixture шесть синтетических сценариев и ни одного платного запроса.