数学靠 RL、文科靠 RLHF?——一文拆解大模型高考提分「双引擎」逻辑
·
目录
- 前言:当大模型走进高考考场
- 数学高分公式:RL 的「题海」战术
- 文科高分密码:RLHF 的「人类口味」调优
- 实战对比:两种策略的得分曲线
- 未来展望:从高考到通用智能
- 小结 & 行动召唤

1. 前言:当大模型走进高考考场
今天,我们把大模型送进高考考场,让它同时参加数学和语文考试。
成绩出来后,一件有趣的事发生了:
- 数学卷:用强化学习(RL)猛刷题海,分数直线上升;
- 语文卷:用 RL 反而越刷越低,换上 RLHF(人类反馈强化学习)才止跌回升。
为什么同一只模型,需要两套截然不同的训练方案?
答案藏在「奖励」二字里。
图 1:考场示意图(大模型坐在课桌前,桌上摊着数学与语文两份试卷)
2. 数学高分公式:RL 的「题海」战术
数学有标准答案,奖励函数天然清晰:
- 做对了 +1,做错了 −1,步骤分给 0~1 的连续值。
- 只要把题目喂够,模型自己就能在「试错 → 高分」的闭环里狂奔。
图 2:RL 训练得分曲线(随训练步数上升,分数稳步提高)
一句话总结:
数学靠「题感」,题感靠「题量」,RL 就是最高效的刷题机器。
3. 文科高分密码:RLHF 的「人类口味」调优
语文作文没有绝对对错,只有 “人类觉得好不好”。
如果仍用 RL,模型会把 “字数多”“堆辞藻” 误当高分秘籍,结果离题万里。
改用 RLHF:先让人类老师给作文打 1–5 星,再把评分当成奖励信号。
RLHF 三步走
| 步骤 | 关键词 | 说明 |
|---|---|---|
| ① 采样 | Sampling | 同一题目生成 8 篇不同风格作文 |
| ② 排序 | Ranking | 人类老师仅给出相对排序 |
| ③ 微调 | PPO | 用排序训练奖励模型,再优化策略 |
图 3|RLHF 闭环示意
结果:
- 2 万条人类反馈 → 作文均分
42 → 52/60 - 「空洞辞藻」↓37%,「真情实感」↑29%
一句话总结:
文科靠“人味”,人味靠 RLHF,把人类老师请进训练循环才靠谱。
4. 实战对比:两种策略的得分曲线
| 训练方式 | 数学 150 分 | 语文 60 分作文 | 备注 |
|---|---|---|---|
| 纯 RL | 141 | 42 | 作文套路化 |
| 纯 RLHF | 128 | 52 | 数学奖励稀疏 |
| RL + RLHF 分段 | 145 | 54 | 1+1>2 |
图 4|蓝:纯 RL / 橙:纯 RLHF / 绿:分段训练
5. 未来展望:从高考到通用智能
- 分科奖励
不同子任务用不同奖励函数,像高考文理分卷一样自然。 - 过程奖励
文科尝试 每段即时反馈,解决长文本稀疏奖励难题。 - 可解释奖励模型
把 5 维评分(立意、结构、文采、扣题、情感)可视化,让模型知道 “哪里好”。
图 5|可解释奖励仪表盘 Mockup
6. 小结 & 行动召唤
- 数学高分:RL 题海战术永不过时。
- 文科高分:RLHF 引入人类老师,效果立杆见影。
- 复合任务:先 RL 后 RLHF 的分段训练最稳健。
🎯 今天就把奖励函数拆成两份试试!
点个「在看」、转发给同事,一起把模型送进「清北」。
更多推荐

所有评论(0)