第九章 评估 (上) —— 存在一个简单的正确答案
-
评估方法: 构建测试集,包含用户问题和理想答案。
-
流程:
-
找出相关产品和类别名称: 编写函数
find_category_and_product_v1,从用户输入中解析产品和类别。 -
在一些查询上进行评估: 使用简单查询测试模型,发现格式错误等问题。
-
更难的测试用例: 测试复杂查询,观察模型表现。
-
修改指令以处理难测试用例: 在 Prompt 中添加“不要输出任何不符合 JSON 格式的额外文本”等指令。
-
在难测试用例上评估修改后的指令: 验证改进效果。
-
回归测试: 验证模型在以前的测试用例上仍然有效。
-
收集开发集进行自动化测试: 定义
msg_ideal_pairs_set,包含标准答案。 -
通过与理想答案比较来评估测试用例: 编写函数
eval_response_with_ideal,比较模型输出与理想答案。 -
在所有测试用例上运行评估,并计算正确的用例比例: 计算准确率,评估系统性能。
-
转载自 CSDN-专业IT技术社区
原文链接:https://blog.csdn.net/marsjin/article/details/166341980




