[TOC]

Conversational Learning Diagnosis via Reasoning Multi-Turn Interactive Learning

https://arxiv.org/pdf/2603.03236

AAAI 2026

Intro

对话式学习非常要求教师持续判断学生当前的认知状态

Q1

已有的认知状态建模方法,如知识追踪,是离散化的标签形式

1题目 1:答对
2题目 2:答错
3题目 3:答对

离散标签不适合对话教学,无法提供足够的上下文

同时认知状态在对话中是不断变化的

Q2

已有的AI tutor将认知状态作为最终教师回复的中间步骤

尚未独立研究认知状态的有效性、是否可靠,同时不够细粒度

难以验证

Method

核心框架:
$$
Previewer\to Analyzer\to Reasoner \to Reflector
$$

Behavior Previewer 行为模式的假设空间

$$
B_t = LLM(S_{t-1},e,K_e,P_b)
$$
输入:

  • $S_{t-1}$:第$t-1$轮的认知状态
  • $e$:当前正在教学的问题
  • $K_e$:解决$e$需要涉及的相关知识点

论文在这里先不做诊断,而是为后续诊断提供一个行为模式的假设空间


论文参考了ZPD-Behavior Schema理论(Zone of Proximal Development)

根据学生的认知状态、题目、相关知识点,将学生接下来可能的行为分为三类

注意,是指可能会做出的行为,而不是是否做出整道题目

  • Mastered:根据学生先前认知状态,预计学生已经能够表现出来的行为。
  • Acquirable:学生目前未必能独立完成,但经过教师指导后可能完成的行为。
  • Inaccessible:即使教师给予指导,学生目前仍无法完成的行为。

输出

  • $B_t$
    • 具体的行为描述
    • 该行为对应的知识点$KC \in K_e$

输出的格式大致上是:

 1Mastered
 2- 1
 3  - Behavior: 学生能够计算餐饮原价:80 + 10 = 90
 4  - Associated KCs: Addition
 5
 6- 2
 7  - Behavior: 学生能够计算税额:90 × 10% = 9
 8  - Associated KCs: Percentage
 9
10Acquirable
11- 1
12  - Behavior: 在教师提示“从总账单中减去含税餐饮金额”后,学生能够完成:140 - 99 = 41
13  - Associated KCs: Subtraction
14
15Inaccessible
16- 1
17  - Behavior: 即使教师指出需要使用减法,学生仍无法确定被减数和减数,也无法解释所得差值为何是小费。
18  - Associated KCs: Subtraction

State Analyzer

$$
S_t = LLM(S_{t-1},B_t,d_t,e,P_a)
$$
输入

  • 第$t$轮的对话记录$d_t$​​:必然是(教师,学生)的一个对话pair

输出

  • $S_t$​是一个结构化的 key-value 表示,针对每一个KC
    • level:该知识点掌握等级(GoodFairPoor
    • explanation
 1S_1 = {
 2  "Addition": {
 3    "level": "Good",
 4    "explanation": "The student correctly computes 80 + 10 = 90."
 5  },
 6
 7  "Percentage": {
 8    "level": "Good",
 9    "explanation": "The student correctly computes 10% of 90 as 9."
10  },
11
12  "Subtraction": {
13    "level": "Poor",
14    "explanation": "The student does not use subtraction to isolate
15                    the gratuity from the total bill."
16  }
17}

相当于Previewer列出了每个KC的程度,所对应不同级别的行为模式

Analyzer根据行为模式选择对应的程度

不是使用模型分析学生的认知状态

而是让学生的认知状态匹配模型的理解

这里似乎可以做一个id分配,这样还能检测id对应的级别和模型输出是不是一致的

从代码层面做匹配

Performance Reasoner

$$
y_t = LLM(S_t,e,P_r)
$$
根据相关内容预测是否学生能够掌握该问题

输出

  • $y_t$:masterednot mastered
  • rationale

注意这个过程,输入只有$S_t$是与学生相关的,没有传入任何对话

因此这里的假设是,如果$S_t$是准的,那么$y_t$也应该是准的

Chain Reflector

首先先前的内容会进行存储,记为$M_t$

每一轮的单轮记录$h_t$有:

  • 当轮的对话信息$d_t$
  • $B_t$行为模式假设
  • $S_t$:输出的认知状态

多轮$h_i$组成了完整的$M_t$

在每个交互轮次中

当 Performance Reasoner 的预测结果$y_t$

与观察到的学生实际表现之间出现不一致时

MathDial 和 CoMTA两个数据集,对于一轮对话

  • 学生最终正确解决问题,$r_{ue} = mastered$
  • 否则,$r_{ue} = not$

但是实际使用的时候如何得到这个$r$论文没有详细说明

发生冲突时,说明$y_t$的来源$S_t$必然出现了问题

因此需要进行check

触发Chain Reflector模块进行检查

$$
R = LLM(M_t, P_{reflect})
$$

提示词重点判断$B_t$是否为$S_t$提供了充分的依据

输出:

  • 是否正确accnot acc
  • 分析理由

这里论文的逻辑感觉有漏洞

重新调用Analyzer,提供分析理由,重新生成$S_t$

重复迭代过程

只要$S_t$是对的,那么$y_t$应该是对的

Exp

核心假设:只要$S_t$是对的,那么$y_t$应该是对的

RQ1: 学生表现预测

=

这里不触发Reflector

比较$y_t$是否和$r_{ue}$一致

RQ3: 模拟辅导

确认能否让学生更容易、更快地答对问题

从数据集中挑选:一直到最后一轮之前都没有答对问题的数据对话

学生由InstructGPT模拟

两个基线:

  • DA:直接分析认知状态,生成教学提示
  • DR:直接根据学生回答生成下一步回复

评价指标:

  • Correct Rate,设定为最终答对的对话数/总对话数
  • Avg Turns:平均需要多少轮对话
  • Intersection Average Turns:三个方法都成功回答正常的数据,平均需要多少轮对话

人工标注

取了一些数据让人工打分

Planning-Guided Tutoring with Assessment-Driven Memory for Pedagogical LLM Tutors

2026.acl-long.325.pdf

ACL2026

Intro

解题模型的目标通常是:

尽快给出正确答案和推理过程。

而一个教学模型的目标应该是:

根据学生当前的理解程度,逐步引导学生自己构造出解法。

作者认为AI Tutor教学应该坚持脚手架式教学的原则,让学生独立完成问题

核心挑战:

  • 保持数学推理的严谨性、正确性
  • 对学生认知状态变化敏感

早期方法主要通过提示词,要求模型扮演教师、遵守教学风格

但是对话只要变长,模型就会逐渐偏离轨道、失去逻辑

还有一些工作使用了SFT、RL做优化

但是他们都有以下问题:

  • 缺少显式教学规划
    • 容易导致:前后指导不一致、推理和教学步骤碎片化、过早泄露答案
  • 对学生认知状态的适应不足
    • 模型容易产生通用化反馈

Method

Planing

给定问题$Q$,有解题步骤:(LLM生成)

$$
R(Q) = \left { r_1, r_2, …, r_n \right }
$$
作者对每个步骤$r_i$,构造了一个局部引导问题和预期答案

从而得到教学计划:(LLM生成)

$$
P(Q) = \left[ (q_1,a_1), …\right]
$$

Tutoring

对于第$k$轮,已有记忆
$$
M_{k-1} = \left ( P(Q), p_{k-1}, H_{k-1}\right )
$$

  • $P(Q)$是教学计划
  • $p_{k-1}\in \left{0,1\right }^N$,例如$[1,1,1,0,0]$​表示每个教学步骤是否完成
    • 长度等于N
    • 此时表示推进到第四个教学步骤
  • $H_{k-1} = [(L_1,T_1,s_1), …]$
    • L和T表示老师与学生的对话
    • 推断的学生状态 $s_i$

当收到学生的新发言$L_k$​时

首先做一次评估

$$
s_k = Assess(L_k,M_{k-1})
$$
得到学习者的状态

然后根据当前状态,生成教师回复

$$
T_k = Act(L_k,s_k,M_{k-1})
$$
根据$s_k$,$T_k$可能是不同的策略

  • 推进到下一步骤
  • 针对当前教学步骤给出进一步提示

同时$s_k$的取值以及对应所有变量的操作如下

sk

根据$s_k$修改对应的$p_k[t]$

当$p_k$全部为1时结束

Train

  • 原数据:BigMath 数据集

使用上述框架生产了数据

并且使用较强的模型对每一个环节进行校验,筛选合法数据

Qwen2.5-7B-Instruct 进行微调,从而得到 ScaffoldLM-7B

Exp

  • 前六个维度:使用baseline与豆包学生进行交互,外部LLM进行judge评分
    • 答案准确性
    • 分步骤支架教学
    • 主题遵循
    • 问题质量
    • 指导质量
  • 自适应反馈:由人工标注三类数据(回答正确、回答错误、提出问题)
    • 给定对话历史,模型需要生成下一条教师回复
    • LLM检查该回复是否在认知层面与人工标注的学习者状态相匹配

同时使用tutorRL的方式测试了

  • 学习者解题成功率的提升幅度
  • 直接泄露解法的对话占全部对话的比例

“学生”是固定的 Llama-3.1-8B-Instruct

  • 先让 Llama-3.1-8B-Instruct 独立解题
  • 等概率选择两种方式进行辅导
    • 学生先提交一个尝试,然后 Tutor 针对该尝试辅导
    • Tutor 先开始提问,主动引导学生进行解题
  • 结合对话重新做一次题

From Knowing to Teaching: Scaffolding Pedagogical Decisions for LLM Agent

2026.acl-long.1328.pdf

ACL2026

Intro

作者认为LLM的知识够多,欠缺的是知识组织和教学决策能力

不知道哪些知识适合当前学生;

不知道应该先讲什么、后讲什么;

不知道测验只能检测已经教过的目标;

不知道教材、例题、模板和题库承担不同作用

现有方法:

  • 对单份文档进行个性化处理
  • 根据主题直接生成课程
  • ….

这些方法都没有同时建模区分专业教学的三个关键决策:

  • 选择:识别材料的教学意图

    • 什么应该进入课程?材料应该怎样使用?
    • 不只是RAG
  • 编排:建立逐步递进的认知过程

    • 内容应该按什么顺序出现?
  • 综合:保证不同教学组件之间的一致性

    • 各个课程组件是否在教同一节课?
    • 形成一个有闭环的、连贯的教学系统

这里切入点主要是

  • 多文档摘要研究解决“怎样融合多个来源”;

  • 教育内容生成研究分别解决幻灯片、题目或教案的生成。

作者希望解决:大多解决某一种教学产物的生成,但缺少一个以教学理论为依据、能理解多份材料用途,并保证课件、讲稿和测验相互一致的端到端系统

Method

Source

三个模块为什么是对的

我们对三名 K–12 教育工作者进行了半结构化访谈。他们分别教授中国文学、英语和生物,教学经验从 1 年到 18 年不等

Formulation

有教学文档集合$D = {d_1, d_2, …}$

课程要求描述$R$

目标是生成一节课$L = \left{ c_1, c_2 ,…\right}$

其中$c_i$是一页ppt、一段讲稿、或者视觉画布、测验题


Explorer (Selection)

首先需要负责从源文件$D$中进行解析文档

  • 解析 PDF

  • 转写音频

  • 从视频中抽取代表性画面

Explorer 会使用一个包含六种类别的教学意图体系,对每个内容块进行分类

  • 内容(Content):核心知识
  • 先备知识(Prerequisite):默认学习者已经掌握的背景知识
  • 补充材料(Supplementary):辅助解释的材料
  • 应用(Application):现实世界中的示例
  • 评估(Assessment):题目模式
  • 风格(Style):形式与呈现方式方面的指导

教什么、学习者已经知道什么、如何解释、为什么重要、如何评估,以及如何呈现

接下来进行筛选组织

使用一个ReAct架构的Agent

  • 工具:语义搜索、数据块获取

  • 在特定意图对应的提取目标指导下,反复查询文档

  • 分析当前需求→语义搜索→获取相关 chunk→检查是否足够→继续搜索或停止

    • 搜索 Content:核心定义、知识点……
    • 搜索 Assessment:常见题型、难度信息……
    • ….

ReAct觉得内容收集足够,满足意图,最终得到一个chunk pool

Chunk内容意图来源
(c_1)为什么计算机需要排序Application教材第1页
(c_2)冒泡排序的定义Content教材第7章
(c_3)冒泡排序交换动画Supplementary视频 02:10
(c_4)对数组执行一轮冒泡排序Assessment试卷第3题
(c_5)冒泡排序复杂度为 (O(n^2))Content教材第7章
(c_6)比较冒泡排序和快速排序Assessment习题集第5题

Planner

首先是提取学习目标

输入是上述的chunk pool

输出:

 1LO1:学生能够说明为什么需要排序
 2来源:c1
 3
 4LO2:学生能够解释冒泡排序的工作原理
 5来源:c2、c3
 6
 7LO3:学生能够对一个给定数组执行冒泡排序
 8来源:c2、c3、c4
 9
10LO4:学生能够分析冒泡排序的时间复杂度
11来源:c5
12
13LO5:学生能够比较冒泡排序和快速排序
14来源:c5、c6

每个学习目标都要和具体的源材料绑定,以保证生成内容忠实于原文,并支持教师追溯来源


对学习目标进行分级

输入:

1LO1:说明为什么需要排序
2LO2:解释冒泡排序原理
3LO3:执行冒泡排序
4LO4:分析时间复杂度
5LO5:比较两种排序算法

输出:

学习目标Bloom 层级
LO1:说明为什么需要排序Remember
LO2:解释冒泡排序原理Understand
LO3:执行冒泡排序Apply
LO4:分析时间复杂度Analyze
LO5:判断哪种算法更合适Evaluate

布鲁姆认知目标分类法(Bloom et al., 1956)提供了一种有原则的排序方法,将认知活动划分为六个复杂度逐渐提高的层次

  • 记忆→理解→应用→分析→评价→创造

按照认知难度排序后,进行设计组件级课程结构

例如:

组件类型对应目标Bloom 层级内容
(s_1)SlideLO1Remember为什么需要排序
(s_2)SlideLO2Understand冒泡排序的比较与交换
(s_3)SlideLO3Apply[5,2,4,1] 执行第一轮
(q_1)QuizLO3Apply预测下一次交换
(s_4)SlideLO4Analyze比较次数与 (O(n^2))
(s_5)SlideLO5Evaluate与快速排序比较
(q_2)QuizLO5Evaluate为具体场景选择算法

Genderator

按既定的顺序完成生成

所有记忆需要按结构落盘,作为必要的上下文

上下文根据顺序是从左到右依次揭露的

并且需要检验生成内容的LO等是否一致

Exp

经典的LLM Judge + 人类评审

附带人机一致性检验