Что мы измеряем
Корректность задач, находки безопасности, регрессии, время до проверенного завершения, человеческие исправления и расход токенов.
ПРОГРАММА ДОКАЗАТЕЛЬСТВ
Сильные утверждения должны поддаваться проверке. Слепая оценка продолжается. Здесь будут опубликованы методики и валидированные результаты.

Корректность задач, находки безопасности, регрессии, время до проверенного завершения, человеческие исправления и расход токенов.
Сопоставимые задачи, раскрытые версии агентов и моделей, фиксированные условия и слепая оценка, где уместно. Отчёты включат размеры выборок, даты и неопределённость.
Возможности CodePulse документированы. Сравнительные результаты не публикуются, пока оценка не завершена. Мы не заявляем рейтингов моделей или процентов улучшения.
CodePulse
Выбирайте своего агента. Контролируйте приложение. Подкрепляйте выпуск доказательствами.