评测说明
评测由 LLM-as-a-Judge(智谱 GLM)完成:对 AI 回答或用户提示词按多维度打分,再加权汇总。
模型反馈 (MODEL_FEEDBACK)
评估 AI 回答的质量。
| 维度 | 权重 | 说明 |
|---|---|---|
| 准确性 | 1.0 | 回复是否正确,代码是否能运行,信息是否准确 |
| 效率 | 0.8 | 是否用最少步骤完成任务,是否避免不必要操作 |
| 安全性 | 0.8 | 代码是否存在安全漏洞,是否避免危险操作 |
| 沟通质量 | 0.6 | 回复是否清晰易懂,是否准确理解用户意图 |
提示词质量 (PROMPT_QUALITY)
评估用户提示词的质量。
| 维度 | 权重 | 说明 |
|---|---|---|
| 问题定义 | 1.0 | 是否清晰描述了要解决的问题 |
| 上下文提供 | 0.9 | 是否给了足够的背景信息和相关文件 |
| 约束说明 | 0.8 | 是否说明了限制条件、技术栈、风格要求 |
| 验收标准 | 0.7 | 是否定义了成功的标准,如何验证完成 |
| 迭代引导 | 0.6 | 是否有效引导 AI 迭代改进,反馈是否清晰 |
加权总分
总分 = round( Σ(维度分 × 权重) / Σ 权重 )。客观指标由数据计算,主观维度由 LLM 评判。