模型微调与 A/B 测试
微调自定义模型,运行 A/B 测试对比模型效果
模型微调与 A/B 测试
模型微调让您可以基于基础模型训练出更贴合业务场景的专属模型,A/B 测试则帮助您科学对比不同模型的实际效果,用数据驱动模型选型决策。两项能力共同构成了模型效果优化的闭环。
本功能面向对模型效果有更高要求的进阶用户。
训练模板
系统提供标准训练模板,帮助您快速准备训练数据并启动微调任务。
获取训练模板
- 进入「AI 能力 > 模型微调」页面
- 点击「获取训练模板」,下载标准模板
- 模板包含数据格式说明和示例样本
模板字段
{
"messages": [
{ "role": "system", "content": "你是一个 SEO 专家助手" },
{ "role": "user", "content": "帮我优化标题" },
{ "role": "assistant", "content": "优化后的标题..." }
]
}
!TIP 训练样本质量决定微调效果,建议准备 100 条以上高质量样本,覆盖典型业务场景。
校验训练数据
上传训练数据前,系统会自动校验数据格式,避免因格式错误导致训练失败。
校验流程
- 准备好训练数据文件(JSONL 格式)
- 在页面选择目标基础模型
- 上传数据文件并点击「校验」
- 系统返回校验结果:
- 格式是否正确
- 样本数量是否达标
- 是否存在重复或低质量样本
- Token 总量预估
校验规则
- 每条样本必须包含完整的 messages 数组
- system / user / assistant 角色齐全
- 单条样本 Token 数不超过模型上下文限制
- 文件总大小不超过上传限制
!WARNING 校验不通过的数据请修正后重新上传,强行训练可能导致模型效果劣化。
训练成本估算
启动微调前,系统会根据训练数据量预估训练成本,帮您控制预算。
估算维度
成本估算综合考虑以下因素:
- 训练样本数量
- 平均样本 Token 长度
- 训练轮次(Epoch)
- 基础模型单价
- 是否使用验证集
查看估算
提交训练数据后,系统会返回预估成本,包括:
- 预计训练时长
- 预计 Token 消耗
- 预计费用金额
!NOTE 估算结果为参考值,实际费用以训练完成后的真实消耗为准。
启动微调任务
完成数据校验和成本确认后,即可启动微调:
- 选择基础模型(如 GPT-4o、通义千问等支持微调的模型)
- 上传已校验的训练数据
- 配置训练参数:
- 训练轮次(建议 2-3 轮)
- 学习率
- 批次大小
- 确认成本估算后提交任务
- 在任务列表中查看训练进度
训练完成后,微调模型会自动注册到供应商列表,可在对话和生成中选用。
A/B 测试
A/B 测试用于科学对比两个模型的实际效果,用数据决定哪个模型更适合您的业务。
创建 A/B 测试
- 进入「AI 能力 > A/B 测试」页面
- 点击「新建测试」,配置:
- 测试名称
- 模型 A(对照组,通常是当前在用模型)
- 模型 B(实验组,通常是候选新模型)
- 测试问题集(一组标准问题)
- 流量比例(如各 50%)
- 启动测试后,系统会向两个模型分发相同问题
查看测试结果
测试运行一段时间后,可查看对比结果:
- 响应质量评分(人工或自动评估)
- 平均响应延迟
- Token 消耗对比
- 成本对比
决策建议
根据测试结果做出决策:
- 模型 B 全面优于 A → 切换到模型 B
- 模型 B 效果更好但成本高 → 按场景分流
- 模型 B 无明显优势 → 保持现状
!TIP A/B 测试建议持续至少一周,覆盖足够样本量后再做决策,避免偶然性。
API 参考
| 方法 | 路径 | 说明 |
|---|---|---|
| GET | /api/ai/models/training/template | 获取训练模板 |
| POST | /api/ai/models/training/validate | 校验训练数据 |
| GET | /api/ai/models/training/estimate-cost | 训练成本估算 |
| POST | /api/ai/models/ab-test | 创建 A/B 测试 |
| GET | /api/ai/models/ab-test/{id} | 查看 A/B 测试结果 |
相关链接
此页有帮助吗?