• 熱門
  • 地方
  • 生活
  • 產經
  • 綜合
  • 娛樂
  • 文教
  • 身心𩆜
  • 醫藥健康
  • 旅遊
  • 美食
  • 體育
  • 法律天地
  • 合作媒體
  • 熱門
  • 地方
  • 生活
  • 產經
  • 綜合
  • 娛樂
  • 文教
  • 身心𩆜
  • 醫藥健康
  • 旅遊
  • 美食
  • 體育
  • 法律天地
  • 合作媒體
最新新聞
高明駿「想家了」闊別台灣26年 重返音樂起點台北圓夢開唱 
未取得我國國籍的外籍配偶,婚姻關係消滅時,能向另一半,行使剩餘財產分配請求權嗎?
薩迦法王不在台灣的日子 法雨遍灑歐亞卻卻也心繫台灣
ARNOLD PALMER 春夏女裝全面登場 讓果嶺經典走進盛夏時尚 藍綠格紋蘊現雅緻靈感
耐斯集團投資40億 台灣第一生化科技股份有限公司新一代智慧廠區動土典禮
S__118497433
S__117071907
S__115499013
S__55287864
墨水映像數位行銷有限公司-w800xh98px
02.Banner_工作區域 1-F
165打詐儀錶版FOR墨新聞
979582
首頁 » AI模型職場任務實測失靈 頂尖技術通過率僅24%
合作媒體

AI模型職場任務實測失靈 頂尖技術通過率僅24%

商傳媒
商傳媒
Published: 2026/07/23
Share
8 Min Read
AI模型職場任務實測失靈 頂尖技術通過率僅24%
AI模型職場任務實測失靈 頂尖技術通過率僅24%
圖/本報資料庫

商傳媒|林昭衡/綜合外電報導

最新研究指出,儘管人工智慧(AI)技術發展迅速,但前沿 AI 模型在實際職場任務中的表現仍遠不及預期。一項由柏克萊加州大學發布的報告揭露,即使是頂尖的 AI 工具,在涵蓋多種職業的測驗中,最高整體通過率也僅有 24%。

這項研究來自柏克萊加州大學的 Center for Responsible, Decentralized Intelligence,旨在評估前沿 AI 工具在各種職場任務上的「就業準備度」。研究人員設計了一套名為「代理人最終考試」(Agents’ Last Exam,簡稱 ALE)的評估工具,其中包含超過 1,500 項由專家制定的任務,涵蓋 55 種不同職業。這些任務不僅包括軟體工程與平面設計等常見的 AI 應用領域,也擴及海事工程、農業、音訊製作及公共衛生營運等。

研究測試了 Anthropic’s Fable 5、OpenAI 的 GPT-5.5、Cursor’s Composer 2.5 及谷歌的 Gemini 3.1 Pro 等先進閉源模型,以及兩款中國開發的開源模型。結果顯示所有模型表現皆不佳,其中 OpenAI 的 GPT-5.5 取得最高分,整體通過率為 24%。然而,在 ALE 最困難的任務層級上,包含 Fable 5 在內的所有前沿代理,成功率均為 0%。值得注意的是,Anthropic’s Fable 5 在任務完成度上與 GPT-5.5 及 Composer 2.5 表現相似,但每完成一項任務的成本卻高出 4 到 12 倍。

研究人員指出,儘管目前的 AI 代理已能解決相當部分的專業任務,但對於需要持續推理、深厚領域專業知識以及長期可靠執行的困難任務,其表現仍與人類水準相去甚遠。柏克萊電腦科學研究員宋曉冬(Dawn Song)表示,即使目前的通過率相對較低,那些由例行性、明確定義程序主導的職業,仍可能率先受到 AI 的衝擊,而需要大量決策的角色則能維持較長時間的韌性。她強調:「關鍵因素不在於產業本身,而在於工作的性質。」

這項研究表明,儘管 AI 產業迄今已投入 1.6 兆美元,但要讓前沿 AI 模型在複雜的現實職場任務中達到人類水準的表現,仍有漫長的路要走。對於台灣企業而言,這項研究結果提供了重要啟示:導入 AI 應著重於自動化例行性工作,而對於需要高度判斷與專業的任務,仍需輔以人類智慧,避免過度期待。

Previous Article 本田美國銷量創新高 生產逼近滿載考慮增設廠房 本田美國銷量創新高 生產逼近滿載考慮增設廠房
  • 關於我們
  • 隱私權政策
  • 聯絡我們
  • 關於我們
  • 隱私權政策
  • 聯絡我們
Copyright©MORE News
Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?

為了帶給你更好的瀏覽體驗我們的網站中有使用Cookie,幫助我們改善網站的結構和行銷分析。如果你同意使用請點擊了解,我們會權利提供你更完善的服務!