刘点的头像TennTenn
OPEN TO OPPORTUNITIES

知了评课AI课堂分析系统

多模态 AI 教学诊断与课堂评课工作台

AI 教学诊断报告界面

概述

业务挑战与产设职责概述

挑战

常态化教研里,结论常常说不清依据。要让评课结果经得起组内讨论和人工复核,并把诊断真正嵌进听课 → 诊断 → 反馈这条业务闭环,而不是评完就断。

机会

把课堂音视频里零散的互动、提问与时间切片,整理成可对照、可复用的评价依据。不只是多一份报告,而是给一线教师、教研员和管理者一套能对齐口径的教学评价语言。

时间

2025 — 至今
持续迭代诊断报告与评课工作台

领域

B端产品架构
AI 场景落地
UI / UX 体验设计

职责

  • 需求拆解与 PRD 撰写
  • AI 核心工作流编排
  • 交互设计与高保真交付
  • 产研统筹与敏捷协同

工具

  • Figma
  • Cursor

背景

从听课到改进,中间总是断一层。

评课本该帮老师把下一节课上得更好,现实里却常停在感觉和印象:证据难回溯、标准对不齐、建议落不了地。 知了评课AI课堂分析系统想把录音录像里的互动、提问与时间切片,整理成可讨论、可复核的诊断材料, 让一线教师、教研员和校长能用同一套口径说话,并把结论拆成下周就能试的动作。

流程

0-1 产设全链路流程

1

业务洞察

  • 痛点调研
  • 竞品分析
  • 业务流诊断
  • 需求边界定义
2

产品架构

  • 角色与权限梳理
  • 核心状态机设计
  • AI 意图与逻辑推演
  • MVP 路径规划
3

交互推演

  • 信息架构规划
  • 核心任务流
  • LUI / GUI 融合探索
  • 可用性验证
4

方案交付

  • 高保真可交互原型
  • B端组件库沉淀
  • PRD 需求说明书交付
  • 研发协同与走查
5

业务闭环

  • PoC 逻辑验证
  • 核心链路复盘
  • 下期迭代规划

研究

用户访谈

为了摸清真实评课链路里的卡点,我分别访谈了 一线教师、区教研员、校长 三类角色。问题围绕:

  • 一线教师:平时坐下来研讨评课时,你最看重哪些具体维度,比如师生互动、提问分布?给别的老师写反馈时,又怎么对着这些指标,从课堂里找到站得住脚的证据?
  • 区教研员:跨校听评课时,不同专家对同一个指标的打分标准经常对不齐。你们平时怎么把这条基线拉齐?评完之后,这些核心维度后面有没有提升,又怎么追踪?
  • 校长:全校常态课这么多,管理层怎么摸清各项核心教学指标的整体情况?如果引入 AI 辅助打分,系统里的量表怎么跟学校自己的办学理念和考核标准对上?
一线教师

痛点

评课多半靠记忆和感觉,容易讲得很空,抓不住实质证据。听完别人的指导也常陷入同一困境:大道理都懂了,下周课还是不知道具体怎么改。

诉求

需要能直接跳到的课堂切片,以及互动频次这类客观数据,帮自己把证据找实。评课标准也不要停在抽象条目,最好拆成下一节课能照着做的小动作。

区教研员

痛点

跨校听课时,学校不同、专家不同,评价标尺对不齐,很难形成区域通用的说法。评课活动也经常评完就结束,校本有没有落实很难追踪。

诉求

要一套统一、能量化的诊断口径。希望 AI 先把评价基线拉齐,再把单次听评课变成连续的数据追踪,真正成为推动区域教学质量的抓手。

校长

痛点

对 AI 工具天然警惕,担心标准化评价和本校办学理念打架,老师产生抵触。

诉求

采信 AI 的前提是:结论必须绑回原始视频切片,随时能人工复核。系统还要能配校本评课量表,以及校领导自己的数据看板,让数据既客观,又能直接服务本校师资考核。

研究

竞品分析

我重点对照了三款产品:希沃课堂智能反馈(软硬一体的智慧课堂方案)、棒棒堂 AI 听评课(手机录课的轻量方案),以及飞书妙记——它本是通用会议纪要,但转写和回溯体验做到了标杆。对比时我主要看三件事:课堂怎么采集、诊断怎么给出、结论能不能回到原片复核。

⚠️ 请注意,以下优缺点基于各产品公开资料与试用体验归纳,不同学校的硬件条件和教研制度差异很大,实际体验会因落地方式而不同。

希沃课堂智能反馈

与竞品相比,其主要突出功能包括:AI 四目摄像头无感采集、课后约 10 分钟出报告、「2 维度 8 视角 28 观察点」课堂质量模型、抬头率 / 举手率 / 参与度等学生行为指标,并可关联电子听评课与校本量表。

优点

  • 观察维度极细:提问比、启发指导比、学生稳态比、抬头率、举手率……课堂观察颗粒度是同类里最细的一档。
  • 采集无感:与交互平板、录播深度集成,老师上课无需额外操作。
  • 人机协同评课:AI 报告能和听课老师的评课记录、校本量表合并查看。

缺点

  • 硬件门槛高:必须部署希沃摄像头与智慧教室,普通教室、借班上课基本用不了。
  • 生态绑定:数据与流程锁在希沃体系内,跨校、跨区统一口径成本高。
  • 试用周期长:更适合区域整体采购,单个教研组很难快速上手验证。

棒棒堂 AI 听评课

与竞品相比,其主要突出功能包括:一部手机即可录课、OCR 读取教案与课件、自动划分教学环节、五维二十项观测指标、三份独立诊断报告,支持教研组自定义观察模型和 AI 多轮追问。

优点

  • 使用门槛低:手机录音就能分析,不依赖教室硬件,常态课也能覆盖。
  • 贴近教研语境:对比教案预设与实际授课的偏差,统计提问认知层次与 S-T 曲线。
  • 观察模型可定制:教研组可按学期主题聚焦观察重点。

缺点

  • 证据以声音为主:核心分析依赖转写文本,板书、PPT、学生状态等画面证据偏弱。
  • 结论与切片衔接弱:报告偏「分析结果」,从结论跳回课堂原片复核不够顺手。
  • 管理视角较薄:校级 / 区域层面的横向对比与连续追踪能力有限。

飞书妙记

与竞品相比,其主要突出功能包括:约 98% 准确率的实时转写、声纹区分发言人、文字与音视频逐句对齐跳转、智能纪要(总结 / 待办 / 章节)、自定义提炼维度,并能联动飞书文档、任务与多维表格。

优点

  • 回溯体验标杆:点任意一句话就能跳回原片,发言人时间轴一目了然,「结论可溯源」做到了极致。
  • 结构化能力强:章节纪要、自定义提炼维度,让长录音能被快速读懂。
  • 协作流转顺:多人标注、分享,待办一键进任务,信息不会停在一份文档里。

缺点

  • 不懂教学:面向通用会议,无法对齐课标、学科与课堂观察维度,给不出教学诊断。
  • 没有视觉理解:看不到板书、课件和学生状态,课堂证据只有一半。
  • 不进教研流程:缺少评课量表、校本标准与改进追踪。

三款产品各有一块做到了很好:希沃把观察维度做到最细,但被硬件绑定;棒棒堂用手机把门槛降到最低,但证据主要来自声音;飞书妙记让每句话都能回到原片,却不懂教学。知了评课要占的位置,是把三者接起来——不依赖专用硬件、音视频双通道解析、每条结论绑定时间轴切片可复核,并对齐学校自己的评课量表,嵌回听课、反馈与改进的业务闭环。

系统

多模态数据处理流程

针对常态化录播课数据维度庞杂的难题,设计了拆解 → 提取 → 对齐 → 融合的标准处理管线。采用 ASR 提取语音特征,依托 FFmpeg 抽帧与视觉大模型解析画面意图,最终在统一的时间轴上完成数据重组。以此构建标准化的底层数据基座,让后续 AI 融合诊断的每个判断都有时间点可查,减少幻觉。

多模态数据处理流程:上传素材 → 音视频分离 → ASR 转写 / FFmpeg 抽帧 / 视觉识别 → 时间轴对齐 → AI 融合诊断 → 生成报告

从洞察到方案

五个问题,对应五个场景

访谈和竞品分析最后收敛成五个问题。它们分别来自不同角色,但指向同一件事: 评课结论要有依据,而且要能落到下一节课。方案没有做成一个大而全的平台,而是按谁在什么时候用拆成五个场景,每个场景只解决一个问题。

01

评课靠记忆,证据找不回来一线教师

45 分钟录像都在,但说不清「哪一段」有问题,讨论容易停在感觉上。

把多模态结果翻译成课堂语言,每条结论绑定可回放的课堂切片。

场景一沉浸式评课工作台
02

提问和追问的质量说不清教师 · 教研员

预设的问题链和学生的真实回答常常对不上,追问得好不好,只能靠听课人的经验判断。

把每条提问按认知层级拆开,把追问还原成一条链,看老师能否脱离预设去引导学生。

场景二提问与追问诊断
03

评价标尺对不齐教研员 · 校长

学校、专家各有一把尺子,统一的 AI 标准又容易和校本理念冲突。

评价标准从模型里拿出来,做成学校可配置的量规,AI 按选定的口径出诊断。

场景三校本量规配置中心
04

看不到全校的教学状态校长 · 教研组长

常态课数量大,管理层摸不清系统用得怎样、哪些老师需要支持。

单份报告的数据向上汇总,同一套看板按角色裁剪数据范围。

场景四全景数据洞察看板
05

道理都懂,下节课还是不知道怎么改一线教师

专家评语往往比较概括,AI 报告又缺少权威,两边各说各的。

专家意见与课堂数据二次对齐,建议落到具体片段和下一节课的动作。

场景五专家建议二次评价

场景一 · 一线教师

找证据的沉浸式评课工作台

老师评课最大的障碍不是没有录像,而是 45 分钟里找不到「那一段」。多模态解析的结果对老师来说是一堆转写文本和分数, 我把它翻译成老师熟悉的课堂语言:视频下方按教学环节切出切片卡片,每张卡带时间码、高亮环节标签和 AI 分析, 点任意一段,播放器直接跳到对应时刻;右侧把 SOLO 分层、高频词云这些结果收成一句「AI 洞察」。 老师不需要看懂模型,也能拿着证据评课,而不是凭感觉。

AI 教学诊断报告:左侧课堂视频与智能脉络,右侧学情透视
AI 教学诊断报告 · 视频、智能脉络与学情透视联动

按环节切片,不按时长切

切分依据是教学环节(情境导入、核心讲授、合作探究),每张卡片 = 时间码 + 环节标签 + 课堂内容 + AI 分析,读起来就是一份课堂实录。

标签先行,扫一眼就懂结构

用颜色区分「生活化情境」「重点内容」「小组合作」等环节类型,老师先看整节课的节奏分布,再决定展开哪一段。

每条结论都能回到原片

视频进度条与脉络双向联动,评课对话从「我觉得这里不太好」变成「你看 08:46 这一段」。

场景二 · 教师与教研员

提问与追问诊断:看老师能不能脱离预设

在教研员和老师眼里,追问是整节课最见功力的部分。年轻老师备课时会预设一条问题链,但学生的真实回答往往不按预设走: 有的老师会一直换着问法提问,直到听到想要的答案;有经验的老师则会顺着学生的回答往下追,把思考一步步引深。 前者看起来互动很多,后者才是真正的引导,但两者在录像里很难区分。 所以我们把提问单独拿出来做诊断:每条提问标出布鲁姆认知层级和判定依据,管理类、无效提问单独筛出, 追问则挂在主问题下面还原成提问树,教研时可以逐条看老师有没有脱离预设去回应学生。

全部提问弹窗:追问按提问树挂在主问题下,并标注时间点
追问视图 · 主问题下挂追问,按时间点还原提问链
教师提问深度分析:布鲁姆认知层级与判定依据
提问深度分析 · 每条提问附认知层级与判定依据
全部提问列表:管理类提问、追问、无效提问筛选
全部提问 · 按管理类、追问、无效提问筛选

追问单独成类

提问分成全部、管理类、追问、无效提问四类。「是不是啊」「对不对」这类无效提问被单独标出,老师第一次直观看到自己的提问习惯。

用提问树还原链路

追问挂在触发它的主问题下,带时间码可回放。一眼能看出这是顺着学生回答往下追,还是在同一层级反复换问法。

层级变化比次数更重要

每条提问都有认知层级和判定依据。追问的价值不在多少,而在于有没有把学生从「记忆」「理解」推向「分析」「评价」。

场景三 · 教研员

灵活的校本量规配置中心

不同学校对好课的定义并不一样:有的按新课标,有的有自己的四位课堂观课表。如果 AI 只输出一个统一分数, 学校会觉得它不懂自己的办学理念,报告也就没人用。所以我把评价标准从模型里拿出来,做成可配置的量规模板(系统里统一叫 AI 评价量规): 教研员把校本量规沉淀进系统,老师上传课堂时按场景选择,系统按学段、学科推荐默认项。 同一节课换一把尺子,就能得到对应口径的诊断,标尺统一的问题在学校内部解决,而不是由产品替学校决定。

上传课堂:视频、教案、AI 评价量规与课堂信息
新建评课 · 上传视频与教案,选择 AI 评价量规

量规是配置,不是写死的规则

量规可以创建、复用、共享,标明适用学段、学科和创建人,学校自己的评价体系可以沉淀成资产,不随人员流动丢失。

推荐,但不强制

默认推荐义务教育新课标保证开箱可用,同时保留校本量规的选择权,缓解通用标准与校本理念之间的冲突。

一次录入,服务多项分析

教案用于教学设计与实际课堂的一致性分析,学段、学科、课型用于校准诊断口径,前置补全上下文,后面的报告才准。

场景四 · 校领导与教研组长

全景教学数据洞察看板

校长不看单节课,看的是整体:系统有没有真正用起来、哪些学科覆盖不足、哪些老师需要支持。 看板把分散在每份报告里的数据向上汇总成三层:顶部是本月报告、活跃教师、累计报告等运营指标; 中间按学科、年级看分布;底部落到每位老师的上传与活跃情况。同一套数据按角色裁剪范围, 校领导看全校的学科覆盖,教研组长看本学科近 8 周的活跃趋势和组内成员,为教学管理和师资盘点提供依据。

校领导视角:全校概览看板
校领导视角 · 全校学科、年级使用分布与教师账号明细
教研组长视角:学科活跃趋势看板
教研组长视角 · 本学科近 8 周活跃趋势与组内成员

一套看板,按角色给数据

通过右上角角色切换决定数据范围和模块组合,校领导看「学科使用情况」,教研组长换成「活跃趋势」,不需要维护两套系统。

从指标下钻到具体的人

指标卡 → 分布图 → 教师明细 → 查看详情,宏观判断有数据支撑,发现问题时也能直接定位到老师。

用于盘点,而不是排名

列表突出「最近活跃」,长期未使用的账号标红提示,帮助管理者识别需要支持的老师,而不是公开比较谁的分数高。

场景五 · 专家建议

专家意见 × AI 报告的二次评价

AI 报告再完整,教研里最有分量的仍然是专家的判断,但专家的评语往往比较概括,老师拿到后不知道从哪改。 评完课后,老师可以把专家的听课记录或评语上传到报告里,系统把专家意见与已有课堂数据对齐做二次评价: 先提炼两者的「诊断共识」,再排出最多 3 条「行动优先级」,最后把建议绑定到具体课堂片段, 生成下一节课可以直接照做的「实操锦囊」。

专家建议未上传状态:上传引导与补充分析预告
上传前 · 引导卡说明上传后能得到什么
专家建议已生成:诊断共识、行动优先级与实操锦囊
上传后 · 诊断共识、行动优先级与实操锦囊

空状态本身就是引导

未上传时不留空白,而是预告上传后会补充的三类分析,让老师知道多做这一步能换来什么。

专家为主,AI 负责具体化

保留专家原话作为依据,AI 只做补充理解,把「探究引导不足」翻译成具体的提问改法和步骤,每条建议标注来源。

建议落回课堂时间轴

实操锦囊绑定到对应环节(如 03:37–08:46 合作探究),并拆成课前、课中、课后动作,改进有据可依、可以验证。

交互体验策略

导出一份和网页一样的 HTML 报告

评课报告很少只停留在系统里:老师要发到教研群,教研员要收集课例,公开课还要附在材料里一起交。 最初我们只提供 PDF 和 Word,但反馈很快暴露出一个问题:报告在系统里是可点击、可回看视频的, 一旦导出成文档,时间轴、切片和图表交互全部被压成静态页面,最有说服力的证据反而丢了。 而 B 端系统的网页链接受账号和权限限制,校外的专家、兄弟学校的老师点开就是登录页。 所以我们加了第三种格式:单文件 HTML 报告,老师直接转发,对方用浏览器打开,看到的就和系统里一样。

PDF

优势
版式固定,适合打印、盖章和归档。
局限
完全静态,不能点击、不能播放视频,长报告翻页阅读吃力。

Word

优势
可以二次编辑,方便教研员摘录内容写总结。
局限
图表容易错位,排版在不同电脑上表现不一致,交互同样丢失。

HTML 新增

优势
保留网页交互:环节可展开、视频可回看、图表可查看明细,免登录就能打开。
取舍
不适合直接编辑,所以与 PDF、Word 并存,按用途选择。
知了评课 · AI教学诊断报告 · 我的叔叔于勒.html
新窗口打开 ↗
导出的 HTML 报告示例 · 可以在框内直接滚动和点击

转发即可阅读

一个文件发到微信或教研群,对方不需要账号,手机和电脑浏览器都能打开,解决 B 端链接无法外发的问题。

证据不在导出时丢失

智能脉络、布鲁姆分类、时间分布等模块保持和系统一致的交互,结论依然能回到课堂片段。

三种格式各管一件事

HTML 负责传播和讨论,PDF 负责存档,Word 负责二次编辑。导出时按用途给出说明,不让老师猜该选哪个。

成果与业务复盘

PoC 验证:区级数学教研现场

2026 年 4 月 28 日,上海师范大学第一附属小学(西校区)承办了一场区级展示课,主题是 「基于知了评课系统的有效提问研讨」。到场的有区数学教研员,以及徐汇区多所学校的备课组长和教研组长。 我们用一节四年级数学《条形统计图》做样本,现场研讨围绕场景二的提问与追问诊断展开: 老师提了哪些问题、分别处在哪个认知层级、学生怎么回答、追问有没有顺着学生往下走,每一条都能回到对应的课堂时间点。

上师大附小区级展示课现场教研
区级展示课现场 · 上海师范大学第一附属小学(西校区)
173一节课内自动识别的教师提问,全部带时间码
89%布鲁姆层级判定与教研员人工标注的一致率
40min研讨前的提问梳理时间,原先人工整理约 3 小时
6所现场提出后续试用意向的学校

分类结果经得起复核

两位教研员事先独立标注同一节课,与系统结果对照,分歧主要出现在「理解」和「应用」的边界。因为每条都附了判定依据,现场几分钟就能对齐口径。

研讨从印象变成逐条对照

讨论不再停留在「这节课提问偏低阶」,而是具体到 00:29「是不是啊?」这类无效提问,以及 00:33 开始的一串追问是否真正推动了学生思考。

验证出了下一期需求

现场问得最多的是两件事:教案里预设的问题链能不能和课堂实际对照,同一位老师改进前后能不能对比。这两点直接进入了下一期规划。

成果与业务复盘

来自一线的反馈

「以前评一节课提问好不好,全凭听课老师的经验。现在每条提问都有时间点、有层级、有依据,大家讨论的是同一份证据。区里做提问专题,最缺的就是这个。」
区数学教研员徐汇区
「最有用的是『无效提问』和『追问』两个筛选。组里老师自己都没意识到一节课说了这么多『是不是』『对不对』,点开回放一看,马上知道下节课该改哪。」
小学数学教研组长徐汇区某小学
「报告导出成网页直接发到教研群,没来现场的老师也能点开看视频片段,不用我再一张张截图配文字了。」
四年级数学备课组长徐汇区某小学

下一步

下一期功能规划

PoC 证明了单节课的提问诊断是可信的,下一步要回答的是:老师的提问有没有在变好。 下一期从「看一节课」走向「看一段时间、看一个区域」,三个功能都来自教研现场的反馈。

01 预设与生成对照

读取教案里预设的问题链,和课堂实际的提问、追问逐条对照,标出哪里按预设走、哪里临场生成,帮助年轻老师复盘自己的应变。

02 教师成长档案

同一位老师多节课的提问层级、无效提问占比、追问深度形成趋势,改进前后可以对比,教研组长也能据此安排帮扶。

03 区域专题教研

教研员按「有效提问」等专题汇总多校课例,形成区级基线和优秀追问片段库,让一次展示课的结论沉淀为区域资产。

反思

结语

做知了评课最大的体会是:B 端 AI 产品的价值,不在于模型能算出多少指标,而在于这些指标能不能进入真实的教研流程。 老师要的不是一个分数,而是能拿去和同事讨论的证据;学校要的不是统一标准,而是能装下自己理念的工具; 一份报告要能发出去、被打开、被讨论,才算真正被用上。

所以在每一个设计决策里,我都尽量让 AI 退到证据后面:结论绑定原片,标准交给学校,建议落到下一节课。 上师大附小那场教研让我确认,当诊断可看见、可讨论、可行动,老师是愿意用它来改课的。