模型微调与 A/B 测试

微调自定义模型,运行 A/B 测试对比模型效果

模型微调与 A/B 测试

模型微调让您可以基于基础模型训练出更贴合业务场景的专属模型,A/B 测试则帮助您科学对比不同模型的实际效果,用数据驱动模型选型决策。两项能力共同构成了模型效果优化的闭环。

本功能面向对模型效果有更高要求的进阶用户。

训练模板

系统提供标准训练模板,帮助您快速准备训练数据并启动微调任务。

获取训练模板

  1. 进入「AI 能力 > 模型微调」页面
  2. 点击「获取训练模板」,下载标准模板
  3. 模板包含数据格式说明和示例样本

模板字段

{
  "messages": [
    { "role": "system", "content": "你是一个 SEO 专家助手" },
    { "role": "user", "content": "帮我优化标题" },
    { "role": "assistant", "content": "优化后的标题..." }
  ]
}

!TIP 训练样本质量决定微调效果,建议准备 100 条以上高质量样本,覆盖典型业务场景。

校验训练数据

上传训练数据前,系统会自动校验数据格式,避免因格式错误导致训练失败。

校验流程

  1. 准备好训练数据文件(JSONL 格式)
  2. 在页面选择目标基础模型
  3. 上传数据文件并点击「校验」
  4. 系统返回校验结果:
    • 格式是否正确
    • 样本数量是否达标
    • 是否存在重复或低质量样本
    • Token 总量预估

校验规则

  • 每条样本必须包含完整的 messages 数组
  • system / user / assistant 角色齐全
  • 单条样本 Token 数不超过模型上下文限制
  • 文件总大小不超过上传限制

!WARNING 校验不通过的数据请修正后重新上传,强行训练可能导致模型效果劣化。

训练成本估算

启动微调前,系统会根据训练数据量预估训练成本,帮您控制预算。

估算维度

成本估算综合考虑以下因素:

  1. 训练样本数量
  2. 平均样本 Token 长度
  3. 训练轮次(Epoch)
  4. 基础模型单价
  5. 是否使用验证集

查看估算

提交训练数据后,系统会返回预估成本,包括:

  • 预计训练时长
  • 预计 Token 消耗
  • 预计费用金额

!NOTE 估算结果为参考值,实际费用以训练完成后的真实消耗为准。

启动微调任务

完成数据校验和成本确认后,即可启动微调:

  1. 选择基础模型(如 GPT-4o、通义千问等支持微调的模型)
  2. 上传已校验的训练数据
  3. 配置训练参数:
    • 训练轮次(建议 2-3 轮)
    • 学习率
    • 批次大小
  4. 确认成本估算后提交任务
  5. 在任务列表中查看训练进度

训练完成后,微调模型会自动注册到供应商列表,可在对话和生成中选用。

A/B 测试

A/B 测试用于科学对比两个模型的实际效果,用数据决定哪个模型更适合您的业务。

创建 A/B 测试

  1. 进入「AI 能力 > A/B 测试」页面
  2. 点击「新建测试」,配置:
    • 测试名称
    • 模型 A(对照组,通常是当前在用模型)
    • 模型 B(实验组,通常是候选新模型)
    • 测试问题集(一组标准问题)
    • 流量比例(如各 50%)
  3. 启动测试后,系统会向两个模型分发相同问题

查看测试结果

测试运行一段时间后,可查看对比结果:

  • 响应质量评分(人工或自动评估)
  • 平均响应延迟
  • Token 消耗对比
  • 成本对比

决策建议

根据测试结果做出决策:

  • 模型 B 全面优于 A → 切换到模型 B
  • 模型 B 效果更好但成本高 → 按场景分流
  • 模型 B 无明显优势 → 保持现状

!TIP A/B 测试建议持续至少一周,覆盖足够样本量后再做决策,避免偶然性。

API 参考

方法路径说明
GET/api/ai/models/training/template获取训练模板
POST/api/ai/models/training/validate校验训练数据
GET/api/ai/models/training/estimate-cost训练成本估算
POST/api/ai/models/ab-test创建 A/B 测试
GET/api/ai/models/ab-test/{id}查看 A/B 测试结果

相关链接

此页有帮助吗?

订阅最新资讯

获取 GEO 优化前沿动态与行业洞察