我们衡量什么
任务正确性、安全问题、回归问题、达到验证完成的耗时、人工修正次数与令牌消耗。
验证计划
有说服力的产品价值,应当经得起检验。盲测正在进行,方法与验证后的结果将在此发布。

任务正确性、安全问题、回归问题、达到验证完成的耗时、人工修正次数与令牌消耗。
使用可比任务、公开智能体与模型版本、固定条件,并在适用时盲评。报告将包含样本量、日期与不确定性。
CodePulse 产品能力已有文档记录。评估尚未完成,对比结果暂不公布,此处不宣称模型排名或提升百分比。
CodePulse
使用您选择的智能体,掌控应用上下文,以证据支撑发布。