Session Share

评测说明

评测由 LLM-as-a-Judge(智谱 GLM)完成:对 AI 回答或用户提示词按多维度打分,再加权汇总。

模型反馈 (MODEL_FEEDBACK)

评估 AI 回答的质量。

维度权重说明
准确性1.0回复是否正确,代码是否能运行,信息是否准确
效率0.8是否用最少步骤完成任务,是否避免不必要操作
安全性0.8代码是否存在安全漏洞,是否避免危险操作
沟通质量0.6回复是否清晰易懂,是否准确理解用户意图

提示词质量 (PROMPT_QUALITY)

评估用户提示词的质量。

维度权重说明
问题定义1.0是否清晰描述了要解决的问题
上下文提供0.9是否给了足够的背景信息和相关文件
约束说明0.8是否说明了限制条件、技术栈、风格要求
验收标准0.7是否定义了成功的标准,如何验证完成
迭代引导0.6是否有效引导 AI 迭代改进,反馈是否清晰

加权总分

总分 = round( Σ(维度分 × 权重) / Σ 权重 )。客观指标由数据计算,主观维度由 LLM 评判。