[TOC]
Conversational Learning Diagnosis via Reasoning Multi-Turn Interactive Learning
https://arxiv.org/pdf/2603.03236
AAAI 2026
Intro
对话式学习非常要求教师持续判断学生当前的认知状态
Q1
已有的认知状态建模方法,如知识追踪,是离散化的标签形式
1题目 1:答对
2题目 2:答错
3题目 3:答对
离散标签不适合对话教学,无法提供足够的上下文
同时认知状态在对话中是不断变化的
Q2
已有的AI tutor将认知状态作为最终教师回复的中间步骤
尚未独立研究认知状态的有效性、是否可靠,同时不够细粒度
难以验证
Method

核心框架:
$$
Previewer\to Analyzer\to Reasoner \to Reflector
$$
Behavior Previewer 行为模式的假设空间
$$
B_t = LLM(S_{t-1},e,K_e,P_b)
$$
输入:
- $S_{t-1}$:第$t-1$轮的认知状态
- $e$:当前正在教学的问题
- $K_e$:解决$e$需要涉及的相关知识点
论文在这里先不做诊断,而是为后续诊断提供一个行为模式的假设空间
论文参考了ZPD-Behavior Schema理论(Zone of Proximal Development)
根据学生的认知状态、题目、相关知识点,将学生接下来可能的行为分为三类
注意,是指可能会做出的行为,而不是是否做出整道题目
- Mastered:根据学生先前认知状态,预计学生已经能够表现出来的行为。
- Acquirable:学生目前未必能独立完成,但经过教师指导后可能完成的行为。
- Inaccessible:即使教师给予指导,学生目前仍无法完成的行为。
输出
- $B_t$
- 具体的行为描述
- 该行为对应的知识点$KC \in K_e$
输出的格式大致上是:
1Mastered
2- 1
3 - Behavior: 学生能够计算餐饮原价:80 + 10 = 90
4 - Associated KCs: Addition
5
6- 2
7 - Behavior: 学生能够计算税额:90 × 10% = 9
8 - Associated KCs: Percentage
9
10Acquirable
11- 1
12 - Behavior: 在教师提示“从总账单中减去含税餐饮金额”后,学生能够完成:140 - 99 = 41
13 - Associated KCs: Subtraction
14
15Inaccessible
16- 1
17 - Behavior: 即使教师指出需要使用减法,学生仍无法确定被减数和减数,也无法解释所得差值为何是小费。
18 - Associated KCs: Subtraction
State Analyzer
$$
S_t = LLM(S_{t-1},B_t,d_t,e,P_a)
$$
输入
- 第$t$轮的对话记录$d_t$:必然是(教师,学生)的一个对话pair
输出
- $S_t$是一个结构化的 key-value 表示,针对每一个
KClevel:该知识点掌握等级(Good、Fair、Poor)explanation
1S_1 = {
2 "Addition": {
3 "level": "Good",
4 "explanation": "The student correctly computes 80 + 10 = 90."
5 },
6
7 "Percentage": {
8 "level": "Good",
9 "explanation": "The student correctly computes 10% of 90 as 9."
10 },
11
12 "Subtraction": {
13 "level": "Poor",
14 "explanation": "The student does not use subtraction to isolate
15 the gratuity from the total bill."
16 }
17}
相当于Previewer列出了每个KC的程度,所对应不同级别的行为模式
Analyzer根据行为模式选择对应的程度
不是使用模型分析学生的认知状态
而是让学生的认知状态匹配模型的理解
这里似乎可以做一个id分配,这样还能检测id对应的级别和模型输出是不是一致的
从代码层面做匹配
Performance Reasoner
$$
y_t = LLM(S_t,e,P_r)
$$
根据相关内容预测是否学生能够掌握该问题
输出
- $y_t$:
mastered、not mastered - rationale
注意这个过程,输入只有$S_t$是与学生相关的,没有传入任何对话
因此这里的假设是,如果$S_t$是准的,那么$y_t$也应该是准的
Chain Reflector
首先先前的内容会进行存储,记为$M_t$
每一轮的单轮记录$h_t$有:
- 当轮的对话信息$d_t$
- $B_t$行为模式假设
- $S_t$:输出的认知状态
多轮$h_i$组成了完整的$M_t$
在每个交互轮次中
当 Performance Reasoner 的预测结果$y_t$
与观察到的学生实际表现之间出现不一致时
MathDial 和 CoMTA两个数据集,对于一轮对话
- 学生最终正确解决问题,$r_{ue} = mastered$
- 否则,$r_{ue} = not$
但是实际使用的时候如何得到这个$r$论文没有详细说明
发生冲突时,说明$y_t$的来源$S_t$必然出现了问题
因此需要进行check
触发Chain Reflector模块进行检查
$$
R = LLM(M_t, P_{reflect})
$$
提示词重点判断$B_t$是否为$S_t$提供了充分的依据
输出:
- 是否正确
acc、not acc - 分析理由
这里论文的逻辑感觉有漏洞
重新调用Analyzer,提供分析理由,重新生成$S_t$
重复迭代过程
只要$S_t$是对的,那么$y_t$应该是对的
Exp
核心假设:只要$S_t$是对的,那么$y_t$应该是对的
RQ1: 学生表现预测

这里不触发Reflector
比较$y_t$是否和$r_{ue}$一致
RQ3: 模拟辅导
确认能否让学生更容易、更快地答对问题
从数据集中挑选:一直到最后一轮之前都没有答对问题的数据对话
学生由InstructGPT模拟
两个基线:
- DA:直接分析认知状态,生成教学提示
- DR:直接根据学生回答生成下一步回复
评价指标:
- Correct Rate,设定为
最终答对的对话数/总对话数 - Avg Turns:平均需要多少轮对话
- Intersection Average Turns:三个方法都成功回答正常的数据,平均需要多少轮对话

人工标注
取了一些数据让人工打分
Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM Tutors
ACL2026
Intro
解题模型的目标通常是:
尽快给出正确答案和推理过程。
而一个教学模型的目标应该是:
根据学生当前的理解程度,逐步引导学生自己构造出解法。
作者认为AI Tutor教学应该坚持脚手架式教学的原则,让学生独立完成问题
核心挑战:
- 保持数学推理的严谨性、正确性
- 对学生认知状态变化敏感
早期方法主要通过提示词,要求模型扮演教师、遵守教学风格
但是对话只要变长,模型就会逐渐偏离轨道、失去逻辑
还有一些工作使用了SFT、RL做优化
但是他们都有以下问题:
- 缺少显式教学规划
- 容易导致:前后指导不一致、推理和教学步骤碎片化、过早泄露答案
- 对学生认知状态的适应不足
- 模型容易产生通用化反馈
Method

Planing
给定问题$Q$,有解题步骤:(LLM生成)
$$
R(Q) = \left { r_1, r_2, …, r_n \right }
$$
作者对每个步骤$r_i$,构造了一个局部引导问题和预期答案
从而得到教学计划:(LLM生成)
$$
P(Q) = \left[ (q_1,a_1), …\right]
$$
Tutoring
对于第$k$轮,已有记忆
$$
M_{k-1} = \left ( P(Q), p_{k-1}, H_{k-1}\right )
$$
- $P(Q)$是教学计划
- $p_{k-1}\in \left{0,1\right }^N$,例如$[1,1,1,0,0]$表示每个教学步骤是否完成
- 长度等于N
- 此时表示推进到第四个教学步骤
- $H_{k-1} = [(L_1,T_1,s_1), …]$
- L和T表示老师与学生的对话
- 推断的学生状态 $s_i$
当收到学生的新发言$L_k$时
首先做一次评估
$$
s_k = Assess(L_k,M_{k-1})
$$
得到学习者的状态
然后根据当前状态,生成教师回复
$$
T_k = Act(L_k,s_k,M_{k-1})
$$
根据$s_k$,$T_k$可能是不同的策略
- 推进到下一步骤
- 针对当前教学步骤给出进一步提示
同时$s_k$的取值以及对应所有变量的操作如下

根据$s_k$修改对应的$p_k[t]$
当$p_k$全部为1时结束
Train
- 原数据:BigMath 数据集
使用上述框架生产了数据
并且使用较强的模型对每一个环节进行校验,筛选合法数据
Qwen2.5-7B-Instruct 进行微调,从而得到 ScaffoldLM-7B
Exp

- 前六个维度:使用baseline与豆包学生进行交互,外部LLM进行judge评分
- 答案准确性
- 分步骤支架教学
- 主题遵循
- 问题质量
- 指导质量
- 自适应反馈:由人工标注三类数据(回答正确、回答错误、提出问题)
- 给定对话历史,模型需要生成下一条教师回复
- LLM检查该回复是否在认知层面与人工标注的学习者状态相匹配
同时使用tutorRL的方式测试了
- 学习者解题成功率的提升幅度
- 直接泄露解法的对话占全部对话的比例
“学生”是固定的 Llama-3.1-8B-Instruct
- 先让 Llama-3.1-8B-Instruct 独立解题
- 等概率选择两种方式进行辅导
- 学生先提交一个尝试,然后 Tutor 针对该尝试辅导
- Tutor 先开始提问,主动引导学生进行解题
- 结合对话重新做一次题

From Knowing to Teaching: Scaffolding Pedagogical Decisions for LLM Agent
ACL2026
Intro
作者认为LLM的知识够多,欠缺的是知识组织和教学决策能力
不知道哪些知识适合当前学生;
不知道应该先讲什么、后讲什么;
不知道测验只能检测已经教过的目标;
不知道教材、例题、模板和题库承担不同作用
现有方法:
- 对单份文档进行个性化处理
- 根据主题直接生成课程
- ….
这些方法都没有同时建模区分专业教学的三个关键决策:
选择:识别材料的教学意图
- 什么应该进入课程?材料应该怎样使用?
- 不只是RAG
编排:建立逐步递进的认知过程
- 内容应该按什么顺序出现?
综合:保证不同教学组件之间的一致性
- 各个课程组件是否在教同一节课?
- 形成一个有闭环的、连贯的教学系统
这里切入点主要是
多文档摘要研究解决“怎样融合多个来源”;
教育内容生成研究分别解决幻灯片、题目或教案的生成。
作者希望解决:大多解决某一种教学产物的生成,但缺少一个以教学理论为依据、能理解多份材料用途,并保证课件、讲稿和测验相互一致的端到端系统
Method
Source
三个模块为什么是对的
我们对三名 K–12 教育工作者进行了半结构化访谈。他们分别教授中国文学、英语和生物,教学经验从 1 年到 18 年不等
Formulation
有教学文档集合$D = {d_1, d_2, …}$
课程要求描述$R$
目标是生成一节课$L = \left{ c_1, c_2 ,…\right}$
其中$c_i$是一页ppt、一段讲稿、或者视觉画布、测验题

Explorer (Selection)
首先需要负责从源文件$D$中进行解析文档
解析 PDF
转写音频
从视频中抽取代表性画面
…
Explorer 会使用一个包含六种类别的教学意图体系,对每个内容块进行分类
- 内容(Content):核心知识
- 先备知识(Prerequisite):默认学习者已经掌握的背景知识
- 补充材料(Supplementary):辅助解释的材料
- 应用(Application):现实世界中的示例
- 评估(Assessment):题目模式
- 风格(Style):形式与呈现方式方面的指导
教什么、学习者已经知道什么、如何解释、为什么重要、如何评估,以及如何呈现
接下来进行筛选组织
使用一个ReAct架构的Agent
工具:语义搜索、数据块获取
在特定意图对应的提取目标指导下,反复查询文档
分析当前需求→语义搜索→获取相关 chunk→检查是否足够→继续搜索或停止
- 搜索 Content:核心定义、知识点……
- 搜索 Assessment:常见题型、难度信息……
- ….
ReAct觉得内容收集足够,满足意图,最终得到一个chunk pool
| Chunk | 内容 | 意图 | 来源 |
|---|---|---|---|
| (c_1) | 为什么计算机需要排序 | Application | 教材第1页 |
| (c_2) | 冒泡排序的定义 | Content | 教材第7章 |
| (c_3) | 冒泡排序交换动画 | Supplementary | 视频 02:10 |
| (c_4) | 对数组执行一轮冒泡排序 | Assessment | 试卷第3题 |
| (c_5) | 冒泡排序复杂度为 (O(n^2)) | Content | 教材第7章 |
| (c_6) | 比较冒泡排序和快速排序 | Assessment | 习题集第5题 |
Planner
首先是提取学习目标
输入是上述的chunk pool
输出:
1LO1:学生能够说明为什么需要排序
2来源:c1
3
4LO2:学生能够解释冒泡排序的工作原理
5来源:c2、c3
6
7LO3:学生能够对一个给定数组执行冒泡排序
8来源:c2、c3、c4
9
10LO4:学生能够分析冒泡排序的时间复杂度
11来源:c5
12
13LO5:学生能够比较冒泡排序和快速排序
14来源:c5、c6
每个学习目标都要和具体的源材料绑定,以保证生成内容忠实于原文,并支持教师追溯来源
对学习目标进行分级
输入:
1LO1:说明为什么需要排序
2LO2:解释冒泡排序原理
3LO3:执行冒泡排序
4LO4:分析时间复杂度
5LO5:比较两种排序算法
输出:
| 学习目标 | Bloom 层级 |
|---|---|
| LO1:说明为什么需要排序 | Remember |
| LO2:解释冒泡排序原理 | Understand |
| LO3:执行冒泡排序 | Apply |
| LO4:分析时间复杂度 | Analyze |
| LO5:判断哪种算法更合适 | Evaluate |
布鲁姆认知目标分类法(Bloom et al., 1956)提供了一种有原则的排序方法,将认知活动划分为六个复杂度逐渐提高的层次
- 记忆→理解→应用→分析→评价→创造
按照认知难度排序后,进行设计组件级课程结构

例如:
| 组件 | 类型 | 对应目标 | Bloom 层级 | 内容 |
|---|---|---|---|---|
| (s_1) | Slide | LO1 | Remember | 为什么需要排序 |
| (s_2) | Slide | LO2 | Understand | 冒泡排序的比较与交换 |
| (s_3) | Slide | LO3 | Apply | 对 [5,2,4,1] 执行第一轮 |
| (q_1) | Quiz | LO3 | Apply | 预测下一次交换 |
| (s_4) | Slide | LO4 | Analyze | 比较次数与 (O(n^2)) |
| (s_5) | Slide | LO5 | Evaluate | 与快速排序比较 |
| (q_2) | Quiz | LO5 | Evaluate | 为具体场景选择算法 |
Genderator
按既定的顺序完成生成
所有记忆需要按结构落盘,作为必要的上下文
上下文根据顺序是从左到右依次揭露的
并且需要检验生成内容的LO等是否一致
Exp
经典的LLM Judge + 人类评审
附带人机一致性检验