• 熱門
  • 地方
  • 生活
  • 產經
  • 綜合
  • 娛樂
  • 文教
  • 身心𩆜
  • 醫藥健康
  • 旅遊
  • 美食
  • 體育
  • 法律天地
  • 合作媒體
  • 熱門
  • 地方
  • 生活
  • 產經
  • 綜合
  • 娛樂
  • 文教
  • 身心𩆜
  • 醫藥健康
  • 旅遊
  • 美食
  • 體育
  • 法律天地
  • 合作媒體
最新新聞
把創意戴上身!鄭紫涵桃園創藝工作坊9月16日登場 香氛與時尚串起青年跨文化對話
月薪6萬不是夢!北市9/8起「4天徵才」 1259職缺、30企業搶人才
21國、近5,800名好手同舟競渡!IDBF世界俱樂部龍舟錦標賽圓滿閉幕
中市「幸福毛孩生活課程」最終場 跟著動畫一起走進毛孩奇想世界
溪湖警冒雨協助脫困守護用路安全
S__121495564
S__120643731
首頁 » AI模型職場任務實測失靈 頂尖技術通過率僅24%
合作媒體

AI模型職場任務實測失靈 頂尖技術通過率僅24%

商傳媒
商傳媒
Published: 2026/07/23
Share
8 Min Read
AI模型職場任務實測失靈 頂尖技術通過率僅24%
AI模型職場任務實測失靈 頂尖技術通過率僅24%
圖/本報資料庫

商傳媒|林昭衡/綜合外電報導

最新研究指出,儘管人工智慧(AI)技術發展迅速,但前沿 AI 模型在實際職場任務中的表現仍遠不及預期。一項由柏克萊加州大學發布的報告揭露,即使是頂尖的 AI 工具,在涵蓋多種職業的測驗中,最高整體通過率也僅有 24%。

這項研究來自柏克萊加州大學的 Center for Responsible, Decentralized Intelligence,旨在評估前沿 AI 工具在各種職場任務上的「就業準備度」。研究人員設計了一套名為「代理人最終考試」(Agents’ Last Exam,簡稱 ALE)的評估工具,其中包含超過 1,500 項由專家制定的任務,涵蓋 55 種不同職業。這些任務不僅包括軟體工程與平面設計等常見的 AI 應用領域,也擴及海事工程、農業、音訊製作及公共衛生營運等。

研究測試了 Anthropic’s Fable 5、OpenAI 的 GPT-5.5、Cursor’s Composer 2.5 及谷歌的 Gemini 3.1 Pro 等先進閉源模型,以及兩款中國開發的開源模型。結果顯示所有模型表現皆不佳,其中 OpenAI 的 GPT-5.5 取得最高分,整體通過率為 24%。然而,在 ALE 最困難的任務層級上,包含 Fable 5 在內的所有前沿代理,成功率均為 0%。值得注意的是,Anthropic’s Fable 5 在任務完成度上與 GPT-5.5 及 Composer 2.5 表現相似,但每完成一項任務的成本卻高出 4 到 12 倍。

研究人員指出,儘管目前的 AI 代理已能解決相當部分的專業任務,但對於需要持續推理、深厚領域專業知識以及長期可靠執行的困難任務,其表現仍與人類水準相去甚遠。柏克萊電腦科學研究員宋曉冬(Dawn Song)表示,即使目前的通過率相對較低,那些由例行性、明確定義程序主導的職業,仍可能率先受到 AI 的衝擊,而需要大量決策的角色則能維持較長時間的韌性。她強調:「關鍵因素不在於產業本身,而在於工作的性質。」

這項研究表明,儘管 AI 產業迄今已投入 1.6 兆美元,但要讓前沿 AI 模型在複雜的現實職場任務中達到人類水準的表現,仍有漫長的路要走。對於台灣企業而言,這項研究結果提供了重要啟示:導入 AI 應著重於自動化例行性工作,而對於需要高度判斷與專業的任務,仍需輔以人類智慧,避免過度期待。

Previous Article 本田美國銷量創新高 生產逼近滿載考慮增設廠房 本田美國銷量創新高 生產逼近滿載考慮增設廠房
Next Article 2026一見雙雕藝術季 7月31日起邀您一起「發現鹽裡的光」 2026一見雙雕藝術季 7月31日起邀您一起「發現鹽裡的光」
  • 關於我們
  • 隱私權政策
  • 聯絡我們
  • 關於我們
  • 隱私權政策
  • 聯絡我們
Copyright©MORE News
Welcome Back!

Sign in to your account

Username or Email Address
Password

Lost your password?

為了帶給你更好的瀏覽體驗我們的網站中有使用Cookie,幫助我們改善網站的結構和行銷分析。如果你同意使用請點擊了解,我們會權利提供你更完善的服務!