National Chengchi University
Uedu Main Site
Explore Uedu
Student Console
Register as Member/Login
Research Informed Consent Center
Survey Center
Teacher Console
Course Setup
Support & Messages
Uptime Data

UeduGPTs

--

Jupyters

7

Local AI

--

Uedu Code

--

CISOSE26 Local AI Uedu Code UG26
政治大學 AQI 58 26°C PM2.5 12
AI Reply Desktop Notifications

Show a desktop notification when the AI TA finishes replying

Chat Message Notifications

Notify me when classmates post messages in the forum

Sound notification

Play an alert sound whenever there is a new notification

AI 助教 In press

為學習而設計的蘇格拉底式 AI 助教:跨班重現的成效、使用者感受,與「費力訊號」

Designing and evaluating a Socratic-scaffolded conversational AI assistant for educational tasks: Cross-cohort effectiveness, user perception, and the effort signature

期刊論文 K.-H. Li and C.-K. Chang* (* 通訊作者) International Journal of Human–Computer Interaction

這篇研究在探討什麼

我們把課堂的 AI 助教設計成「先反問,再回答」,然後連續三個學期問學生:這樣好用嗎? 答案很有意思——學生明白地表示這種模式比較累, 但當我們請他們拿它跟「有問必答的 AI」直接比較時, 他們反而在「哪一種讓我真的搞懂」這一題上,給了最高的分數。

我們把這個「覺得比較費力、卻認為比較值得」的成對現象命名為 費力訊號(effort signature),並主張它不是設計的缺點,而是設計正在生效的證據。 本論文由李奎皓老師(第一作者)與張家凱助理教授發表於 《International Journal of Human–Computer Interaction》(IJHCI,Taylor & Francis), 這是一本專門刊登人機互動設計研究的國際期刊—— 也就是說,這篇的讀者不只是教育界,還包括所有在設計 AI 對話介面的人。

為什麼要「故意」讓 AI 不直接給答案?

2025 年一份發表於《PNAS》的大型隨機對照研究(Bastani 等人,近千名中學生)帶來一個令人不安的發現: 讓學生使用有問必答的 AI,當下的解題表現大幅提升(48–127%), 但等到把 AI 收走、讓他們自己作答時,成績反而比沒用過 AI 的同學低了 17%

換句話說,最順手、最令人滿意的 AI 使用方式,可能正在悄悄掏空使用者本來要培養的能力。 這個現象不限於教室——任何「使用者的目標是學會,而不只是做完」的場合都會遇到, 例如新進分析師靠 AI 熟悉產業知識、寫作者在 AI 協助下發展自己的文風、 醫師必須有能力獨立判斷 AI 給的診斷建議。

同一份研究也指出了解方:如果 AI 被設定成不直接給解答、而是要求使用者先說出自己的想法, 這個長期傷害就不會出現。本研究做的,就是把這個「解方」實際做成一套可以長期運作的系統, 並且誠實面對一個現實問題——這樣的 AI,學生會不會因為太麻煩而乾脆不用?

三層設計:讓 AI 幫忙,但不代替思考

論文提出的設計由三層組成,每一層各自擋掉一種「過度依賴」的失敗方式:

  • 第一層/限定教材範圍:AI 只根據授課教師上傳的講義、作業與參考資料回答, 不從整個網路或模型的通用知識裡找答案。 這一層擋的是「答案技術上正確,卻跳過了課程刻意安排的難度階梯」—— 例如學生還在學迴圈,AI 卻直接丟出一行進階寫法把題目解掉。
  • 第二層/預設先反問:學生問「我的程式哪裡錯了?」, AI 會先反問「你原本預期第三圈跑出什麼?實際跑出什麼?」, 等學生說出自己的判斷之後,才給明確的指引。
  • 第三層/看得見的思考層次:系統會自動標記每一則學生提問屬於哪一種認知層次 (記憶、理解、應用、分析、評鑑、創造), 讓教師與研究者能夠觀察「這場對話到底把學生帶到多深」,而不只是看聊了幾句。

需要說明的是,第三層在這篇論文裡只是觀測儀器,不是被檢驗的成效指標—— 它產出的認知層次資料,是另一篇論文的主題,本文沒有拿它當作結論的依據。

一個關鍵的設計決定:是「拖慢」,不是「拒絕」

如果學生說「不要問了,直接告訴我第 4 題答案」,這套 AI 會怎麼做? 答案是:它會先請學生回答一個小問題(例如「如果輸入是空的清單,這個函式應該回傳什麼?」), 學生回應之後,就會給出明確的指引

這是刻意的取捨。硬性拒絕回答,只會讓學生轉頭去用外面沒有任何限制的 AI, 結果是設計完全失效。所以我們選擇把直接回答「延後」而不是「取消」—— 保留學生自願使用的意願,同時在每一次互動中都插入一個必須自己思考的環節。

三個學期、三份調查,得到什麼?

研究在一所大學的 Python 程式設計入門課(修課學生多為非資訊本科系)進行,橫跨三個連續學期, 分成三項互補的調查:

  • 學習表現:兩個班級各自重現(合計 82 人)。 學生在學期初與學期末以同一份 37 題測驗作答, 2023 秋季班平均進步 18.91 分、2024 秋季班進步 17.28 分, 兩班的效果量分別為 1.25 與 1.13(合併 1.20,屬於統計上的「大」效果), 82 人中有 71 人(86.6%)分數上升。 兩個獨立班級的進步幅度只差 1.6 分, 這代表結果不是某一屆學生剛好比較強所造成的偶然。
  • 使用者評價:三個學期都沒有退燒(203 份回應)。 學習價值、任務幫助、介面易用性、繼續使用意願、整體滿意度五個面向, 分數落在 75–79%(其中介面易用性 75.8%,對照國際通用的可用性標準屬於「良好」區間)。 更值得注意的是,四次調查橫跨三個學期,每個面向的變動幅度都不到 4 個百分點
  • 費力訊號:直接請學生比較兩種模式(90 份回應)。 這份問卷專門針對「先反問」這個互動模式提問,結果見下一段。

最有意思的一組數字

在針對蘇格拉底式對話的五個面向中,分數呈現一個乍看矛盾、細想卻很合理的排列:

  • 最低分是「減輕焦慮」(60.7%)。這完全說得通—— 當你卡住、鼓起勇氣發問,AI 卻回你一個問題, 那段「還是不知道答案」的時間被拉長了,對正在掙扎的初學者來說當然不輕鬆。
  • 最高分是「跟有問必答的 AI 相比,哪個讓我理解更深」(69.4%)。 這一組共九道題,請學生就理解深度、思考的條理、面對難題的能力三方面做直接比較。
  • 中間是幫助理解(68.5%)、學習動機(65.4%)、願意推薦(63.1%)。

把這兩端放在一起讀,學生實際上是在說: 「這個模式讓我比較不舒服,但它值得。」 這正是我們定義的費力訊號。 有趣的是,這個現象在人機互動領域早有前例—— Buçinca 等人(2021)就發現,最能減少人們盲目依賴 AI 的設計,往往拿到最低的主觀評價。 這也意味著:如果只用「使用者滿意度」當作優化目標,會系統性地淘汰掉那些真正保護使用者能力的設計。

對設計者而言,費力訊號可以當成一組檢查工具: 如果一套設計兩個成分都沒有(既不費力、也沒有比較後的認可),代表它其實沒有真的改變互動; 只有費力、沒有認可,代表使用者會逐漸放棄它; 只有認可、沒有費力,代表它可能根本沒有擋下過度依賴。

「不退燒」為什麼值得一提

教育科技有一個很常見的現象叫做新鮮感衰退:新工具剛上線時大家都覺得很棒, 一兩個學期後熱度消退、評價下滑。許多論文的評估剛好只做在系統上線的那個時間點, 因此報告出來的接受度往往被新鮮感灌了水。

本研究涵蓋四次調查、三個學期,期中與期末都測, 中途甚至把問卷從 5 點量表改成 7 點量表(這種改動通常會讓分數產生偏移), 結果分數依然穩定。 對一個「刻意讓使用者比較費力」的設計來說,這一點特別重要—— 它顯示把直接回答延後而非拒絕的柔性做法,確實守住了學生繼續使用的意願

一個出乎意料的空結果

我們原本預期「學習動機比較強的學生,最後表現也會比較好」。 但在 2024 秋季班(39 人)的分析中,把學期初測得的內在動機加進預測模型後, 對期末成績的解釋力只增加了 0.4 個百分點,動機與進步幅度的相關幾乎是零。

這個結果要小心解讀,論文本身也把它列為限制:樣本只有 39 人, 而且這群學生的動機分數普遍偏高(7 點量表平均 5.84), 也就是「動機低」的那一端根本沒有出現在樣本裡,統計上不容易驗出差異。 我們如實把它報告為空結果,而不是宣稱「動機不重要」。 它真正的用處是提醒 AI 助教的設計者: 在一群本來就願意學的使用者裡,個別動機差異可能不是值得花力氣去追蹤與介入的變項。

解讀界線(這篇不主張什麼)

與 Uedu 一貫的研究紀律相同,這篇論文對自己的宣稱設有明確界線,這些界線在正式論文中都白紙黑字寫著:

  • 成績進步「伴隨」這套設計,不等於「由」這套設計造成。 研究沒有設置同期的對照組(也就是沒有另一班用「有問必答」版本的 AI), 因此學生的進步同時包含了課程本身、正常學習歷程與 AI 助教的貢獻,無法把功勞單獨歸給設計。 這是論文自列的第一號限制,也是團隊下一個研究要優先處理的問題。
  • 沒有辦法回答「用得越多、進步越多嗎」。 因為同意書架構要求資料在分析前去識別化,個別學生的使用量無法與個別成績對應, 本研究只能在班級層次談關聯。
  • 單一學校、單一課程。三個學期的重現屬於同一所學校內的縱向重現, 不等於跨校、跨學科的普適性。
  • 問卷是研究團隊自行編製的,內部一致性良好(Cronbach's α = .78–.91), 但尚未經過正式的因素結構驗證。
  • 文化脈絡有其特殊性。研究在臺灣的高等教育現場進行, 學生對 AI 應該扮演什麼角色的期待,可能與其他文化不同, 因此論文明確表示不主張文化上的可移轉性

對教師與設計者的啟示

  • 把「不舒服」跟「不好用」分開看。 學生說某個模式比較累,不代表這個設計失敗; 要判斷它是否有效,該問的是「跟直接給答案的版本比,哪個讓你真的學會」這類比較性問題, 而不是只問滿意度。
  • 焦慮那一塊要另外補。 本研究中減輕焦慮是最低分的面向,這是設計上真實的代價。 論文的建議不是放棄反問,而是搭配情感面的鷹架—— 明確肯定學生已經做對的部分、把犯錯正常化、 並且讓學生知道「AI 現在反問你,是為了什麼」。看不見理由的提問,只會讓人覺得被刁難。
  • 這個模式不只屬於教室。 任何「使用者的長期能力比這一次的產出更重要」的場合, 都可以套用同一個三層樣板:限定資料來源、要求使用者先表述判斷、 並且建立可觀察互動深度的量測機制。

在 Uedu 上的實踐:ClassroomGPT 蘇格拉底式對話

這篇論文評估的就是 Uedu 平台上的 ClassroomGPT: 教師可以上傳自己的教材讓 AI 助教只根據課程內容回答, 並透過 system prompt 設定「先反問、再回答」的互動風格; 學生的每一則提問也會自動標記認知層次,讓教師看見思考的深度而不只是使用次數。 需要提醒的是,蘇格拉底式對話是可由教師選擇開啟的教學設計, 平台一般 AI 助教的預設風格仍是盡力清楚回答。

前往使用

本篇甫發表、尚未取得 DOI,資料庫無從建立引用關係,因此暫時無法查核。

甫發表・尚未可查
本篇甫發表、尚未取得 DOI,資料庫無從建立引用關係,因此暫時無法查核。 已接受(in press),尚未取得 DOI。

資料來源:OpenAlex(主)+ Semantic Scholar(補查),資料日期 2026-08-30。 引用次數依資料庫口徑而異;標為「已核對原文」者已取得全文並逐字抄錄引用段落。

引用資訊

K.-H. Li and C.-K. Chang, "Designing and evaluating a Socratic-scaffolded conversational AI assistant for educational tasks: Cross-cohort effectiveness, user perception, and the effort signature," International Journal of Human–Computer Interaction, 2026, accepted (in press).
更多研究
AI 助教 雙角色 Agentic AI 作為 AI 講師與教學助理:對大學英語(EFL)學習者自主性、自我調節學習與內在動機的影響 學習分析 對話即學習:學生與 AI 對話中的學科相關認知投入型態 AI 助教 為學習而設計的蘇格拉底式 AI 助教:跨班重現的成效、使用者感受,與「費力訊號」 AI 評量 以生成式 AI 測驗平台提升學習成效 AI 評量 AI 自動化貼文評分系統促進跨領域知識分享 AI 助教 生成式 AI 圖形化學習輔助工具於智財權課程之分析 AI 助教 生成式 AI Python 學習輔助系統:評估其對儀器自動化技能之影響 AI 助教 Python 課程中對話焦點與學習體驗之相關分析 AI 評量 以提示工程方法透過 LLM 評估教育中的認知表現 學習分析 運用知識圖譜與大型語言模型追蹤分析學習軌跡 數據基礎建設 Educational Omics 教育資料湖:多模態科技輔助學習基礎建設 數據基礎建設 Uedu:橋接 AI、生理感測與課堂實踐的六維 Educational Omics 平台 AI 助教 Uedu:不以監控為前提的分層學習者能動性與審慎個人化 生理感測 從穿戴裝置到課堂:考量個體差異的 HRV 生理監測學習分析可行性研究 學習分析 多模態 VLM 課堂協調:預測學生分心的精確時刻 學習分析 透過嵌入幾何驗證基於自然語言的教育數位孿生於 Python 課程 生理感測 多模態學習分析中的時序延遲效應:生理—行為特徵化 AI 助教 大規模 AI 助教:跨學科採用模式與數百門大學課程的認知投入分析 生理感測 PALM:透過消費級穿戴裝置與大型語言模型實現可擴展的生理感知 AI 輔導 生理感測 基於本地 LLM 的邊緣部署 EEG 睡眠分期協作推理框架 生理感測 C-GRASP:基於臨床推理的情感訊號處理框架 數據基礎建設 異質文本資料可擴展處理之分散式語意分析系統設計 AI 評量 從 AI 素養到科學素養:與高中地球科學教師的生成式 AI 平台共同設計論壇
想做類似研究?

我們提供研究設計諮詢、IRB 支援與資料匯出,讓您的教學實踐也能成為學術研究。

預約討論