目录

  1. 前言:当大模型走进高考考场
  2. 数学高分公式:RL 的「题海」战术
  3. 文科高分密码:RLHF 的「人类口味」调优
  4. 实战对比:两种策略的得分曲线
  5. 未来展望:从高考到通用智能
  6. 小结 & 行动召唤

在这里插入图片描述

1. 前言:当大模型走进高考考场

今天,我们把大模型送进高考考场,让它同时参加数学和语文考试。
成绩出来后,一件有趣的事发生了:

  • 数学卷:用强化学习(RL)猛刷题海,分数直线上升;
  • 语文卷:用 RL 反而越刷越低,换上 RLHF(人类反馈强化学习)才止跌回升。

为什么同一只模型,需要两套截然不同的训练方案?
答案藏在「奖励」二字里。

图 1:考场示意图(大模型坐在课桌前,桌上摊着数学与语文两份试卷)


2. 数学高分公式:RL 的「题海」战术

数学有标准答案,奖励函数天然清晰:

  • 做对了 +1,做错了 −1,步骤分给 0~1 的连续值。
  • 只要把题目喂够,模型自己就能在「试错 → 高分」的闭环里狂奔。

图 2:RL 训练得分曲线(随训练步数上升,分数稳步提高)

一句话总结:
数学靠「题感」,题感靠「题量」,RL 就是最高效的刷题机器。


3. 文科高分密码:RLHF 的「人类口味」调优

语文作文没有绝对对错,只有 “人类觉得好不好”
如果仍用 RL,模型会把 “字数多”“堆辞藻” 误当高分秘籍,结果离题万里。
改用 RLHF:先让人类老师给作文打 1–5 星,再把评分当成奖励信号。

RLHF 三步走
步骤 关键词 说明
① 采样 Sampling 同一题目生成 8 篇不同风格作文
② 排序 Ranking 人类老师仅给出相对排序
③ 微调 PPO 用排序训练奖励模型,再优化策略

图 3|RLHF 闭环示意

结果:

  • 2 万条人类反馈 → 作文均分 42 → 52/60
  • 「空洞辞藻」↓37%,「真情实感」↑29%

一句话总结:

文科靠“人味”,人味靠 RLHF,把人类老师请进训练循环才靠谱。


4. 实战对比:两种策略的得分曲线

训练方式 数学 150 分 语文 60 分作文 备注
纯 RL 141 42 作文套路化
纯 RLHF 128 52 数学奖励稀疏
RL + RLHF 分段 145 54 1+1>2

图 4|蓝:纯 RL / 橙:纯 RLHF / 绿:分段训练


5. 未来展望:从高考到通用智能

  1. 分科奖励
    不同子任务用不同奖励函数,像高考文理分卷一样自然。
  2. 过程奖励
    文科尝试 每段即时反馈,解决长文本稀疏奖励难题。
  3. 可解释奖励模型
    把 5 维评分(立意、结构、文采、扣题、情感)可视化,让模型知道 “哪里好”

图 5|可解释奖励仪表盘 Mockup


6. 小结 & 行动召唤

  • 数学高分:RL 题海战术永不过时。
  • 文科高分:RLHF 引入人类老师,效果立杆见影。
  • 复合任务:先 RL 后 RLHF 的分段训练最稳健。

🎯 今天就把奖励函数拆成两份试试!
点个「在看」、转发给同事,一起把模型送进「清北」。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐