ПРОГРАММА ДОКАЗАТЕЛЬСТВ

Измеряем то, что важно.

Сильные утверждения должны поддаваться проверке. Слепая оценка продолжается. Здесь будут опубликованы методики и валидированные результаты.

Слепая оценка продолжается
01

Что мы измеряем

Корректность задач, находки безопасности, регрессии, время до проверенного завершения, человеческие исправления и расход токенов.

02

Как будут представлены сравнения

Сопоставимые задачи, раскрытые версии агентов и моделей, фиксированные условия и слепая оценка, где уместно. Отчёты включат размеры выборок, даты и неопределённость.

03

Что доступно сегодня

Возможности CodePulse документированы. Сравнительные результаты не публикуются, пока оценка не завершена. Мы не заявляем рейтингов моделей или процентов улучшения.

CodePulse

Следующее изменение. С понятными основаниями.

Выбирайте своего агента. Контролируйте приложение. Подкрепляйте выпуск доказательствами.