測定する項目
タスクの正確性、セキュリティ指摘、回帰不具合、検証完了までの時間、人による修正、トークン使用量。
検証プログラム
価値は検証できてこそ伝わります。ブラインド評価を実施中です。手法と検証済みの結果をここに公表します。

タスクの正確性、セキュリティ指摘、回帰不具合、検証完了までの時間、人による修正、トークン使用量。
比較可能な課題、明示したエージェント・モデルの版、固定条件、適切な場合のブラインド評価を採用。サンプル数、日付、不確実性を記載します。
製品機能は文書化済みです。評価未完了のため比較性能は未公表。モデル順位や改善率は示していません。
CodePulse
エージェントはそのままに。アプリケーションの管理を手元に。リリースの判断には証拠を。