Mercor 研究:AI 做會計已勝過初級會計師,18 個月前還追不上

Elponcrab
分享
Mercor 研究:AI 做會計已勝過初級會計師,18 個月前還追不上

AI 人才與資料公司 Mercor 10 月 1 日發表研究指出,在中等長度、定義清楚的會計任務上,前沿 AI 模型已經比初級會計師更快也更準確,而且勝過研究中表現最好的那一位。研究也發現,18 個月前最好的 AI 模型還達不到會計師約 37% 的平均分數。

12 名持照會計師對上 Claude Opus 5

根據 Mercor 公布的完整論文,研究找來 12 名初級會計師,都是持照的註冊會計師,平均約有 5 年半經驗。題目改編自 Mercor 的 APEX-Accounting 評測,共四個月結作業情境,參與者要從模擬公司的工作檔案中找出正確數字、判斷公司規定的計算方式、完成計算並交出彙總表,每題限時 3 小時。

論文圖表顯示,會計師 23 次作答的準確率分散在 0% 到 90% 之間,耗時從不到半小時到 3 小時不等;Claude Opus 5 單獨作答 20 次,準確率都在 100% 附近,每次只花幾分鐘。Mercor 指出,以每項評分標準的成本計算,前沿模型比人類便宜超過一個數量級。

廣告 - 內文未完請往下捲動

18 個月前最好的模型還不到 37%

論文把歷代模型放在同一組題目上比較。圖表顯示,模型分數大致隨推出時間上升,GPT-4o 只有個位數,2025 年起陸續有模型超過會計師 37% 的平均線,最新一代模型已接近或達到 100%。Mercor 也註明,測試涵蓋預算型與開放權重模型,所以部分新模型的分數仍低於會計師平均。

研究原本想衡量 AI 輔助能讓會計師進步多少,但因為模型單獨作答就拿到滿分,沒有空間測量提升幅度,只好改比較沒有 AI 輔助的人類與 AI。Mercor 也說,這個結果太具挑釁性,他們曾考慮不發表,怕被誤讀。

Mercor:不代表會計師可以被取代

Mercor 強調,這個結果不代表會計師可以被取代。原因之一是這些題目測的剛好是模型最擅長的技能:注重細節、在檔案中搜尋、嚴格遵循指示。題目原本就是為了考倒模型而設計,藏了許多環環相扣的陷阱,出題者事前預估初級會計師平均只會拿 30%,中階會計師約 55%。

另一個原因是測試環境拿掉了許多真實工作的元素,參與者沒有同事可以問,也沒有累積的工作脈絡。研究也沒有衡量與客戶溝通、問對問題、累積隱性知識等能力,Mercor 認為隨著模型接手結構化的細節工作,這些能力會在會計師工作中占更大比重。

風險提示

加密貨幣投資具有高度風險,其價格可能波動劇烈,您可能損失全部本金。請謹慎評估風險。