一、最大的轉折:從「導入 AI」到「規模化 AI」
訊號:兩天四十幾場演講,幾乎沒有一場在說服聽眾「AI 很重要」。
這件事本身就是今年最大的訊號。取而代之的是三種語言:正確率怎麼從 50% 拉到 90%、組織為什麼推不動、成本怎麼算給老闆聽。
勤業眾信林彥良把這個轉折講得最系統化 —— 他提出 AI 規模化的三階段:
高價值個案(PoC) → 模組化 → 大規模部署
↑
多數台灣企業卡在這裡他點名台灣企業已經錯過三次:IoT(嫌設備太貴)、雲端(嫌風險高)、RPA(台灣人力成本比訂閱費便宜)。
這次 AI 你真的不要再錯過了。林彥良 · 勤業眾信
而他最反直覺的一句話是:資料與科技平台反而不是最需要擔心的環節,策略、流程、人才才是關鍵。這與 2023–2024 年「先把資料整理好」的主流論述明顯不同。
佐證這個轉折的具體現象
今年講者普遍拿得出量化成效,而不是願景簡報 —— 玉山金控的警示帳戶偵測省下 50% 人力、91App 的電商上架效率提升 10 倍、廣運的 ABC 品項分析從 2 個月壓到 2–3 天、AIA 的 IRB 會議紀錄從 72 人工小時降到 2 小時。
二、Agentic AI 進入幻滅期,而這是好事
「Agentic」是今年出現頻率最高的詞,但幾乎所有講者談的都是它的難處。
和碩蕭安助直接用自家數據呈現 AI agent 使用高度破碎化的現況(「試了就陣亡」),並引三篇論文解釋為什麼:
| 來源 | 論點 |
|---|---|
| Salesforce | MCP 工具接得越多,agent 準確率大幅下滑 —— 部分場景僅 33%,開源模型甚至只有十幾趴。 |
| Google DeepMind | RAG 的 top-k/向量相似度搜尋存在維度限制,強模型在簡單自建資料集上表現也差。 |
| OpenAI | 模型訓練機制類似「選擇題考試」,亂猜比拒答分數高,是幻覺成因之一。 |
全年會記錄最完整的一份幻滅演化史
91App 李昆謀的電商上架案例,是全年會對「幻滅」記錄得最完整的一份演化史:
| 版本 | 做法 | 結果 |
|---|---|---|
| v1 | LLM 直接讀商品主檔填欄位 | 98% 欄位有填,但一半是錯的(AI 不敢不填) |
| v2 | 加規則「沒信心的不要打」 | 正確率升到 90%,但只填一半 |
| v3 | 要求 AI 每個欄位都寫理由,強迫自我驗算 | 正確率再升 |
| v4 | 把品牌「潛規則」抽成 Rule Engine,不用 AI | Rule 40% + AI 50% + 人工 10%,效率提升 10 倍 |
為什麼說幻滅是好事
Gartner 曲線意義上的「過度期望」退場,代表真實的工程知識開始累積。今年出現了 2024 年還沒有的東西 —— 具體的失敗模式清單、可複製的補救策略,以及願意公開講「我們這樣做失敗了」的講者。
迪威智能葉子雋甚至用整場演講講一個最終沒做成產品的案例(工廠異音偵測),得出的結論是:
AI 產品不只是 product-market fit,還要 technology-product-market fit。好模型不代表能對應到合適場景,能對應場景也不代表可規模化,可規模化也不代表使用者覺得好用。葉子雋 · 迪威智能
三、評測危機:benchmark 與商業可用性正在脫鉤
這是今年最具原創性、也最被低估的一個訊號。
APMIC 吳柏翰分析了 Gemma 3 官方引用的 34 篇評測論文,發現 80% 的評測題型是選擇題,但商業實務幾乎都是問答題。篩出問答題型的評測後,正確率普遍不到 80 分(多在 70 分左右),11 項問答評測中僅 4 項及格。
水的深度不能用磅秤來秤。吳柏翰 · APMIC
他的結論是企業與產業必須共同建立專屬評測標準,不能依賴廠商拿通用評測宣稱「這模型很強」。
- 和碩蕭安助 — 引 OpenAI 論文指出模型訓練機制「亂猜比拒答分數高」,本身就是評測設計誘導出的行為。
- Twinkle AI 黃亮勳 — 做的是相反方向的努力:自建 TMMLU+(含台灣國考題庫)等在地評測,因為通用英文評測測不出繁中場景的可用性。
四、參數量不再是護城河:小模型與垂直化
三組講者從三個不同位置提出同一個論證,證據互補:
| 講者 | 證據 |
|---|---|
| 陳宜昌 · 聯發創新基地 | 可樂旅遊護照 OCR:50 個原本出錯的案例中,Breeze 2 表現優於 Gemini(模型量級小很多);旅遊 Chatbot RAG 3,000 筆問答,Breeze 對比專家回答相似度達 90% 可用標準。 |
| 吳柏翰 · APMIC | 自家 24B 模型在台灣法律垂直領域評測超越 GPT-OSS 120B;VRAM 需求 50GB vs 292GB。 |
| 黃亮勳 · Twinkle AI | 3B 模型 function calling(含 MCP)評測超過 90 分,高於 GPT-4o。 |
這件事的產業意涵:如果一個 24B 模型能在垂直領域打贏 120B、而且 VRAM 少 5 倍,那「買最大的模型」就不再是安全牌。決策重心從選模型轉移到選領域、備資料、做微調。
主權 AI 模型(國家/文化知識)
↓
行業知識模型(金融、半導體…)
↓
企業知識模型(企業專屬,只有你自己有)APMIC 並引 UBS 2025 研究稱 86.6% 企業表示需要微調、NVIDIA 研究稱 70% 的 AI agent 需要 SLM 優化。
五、Physical AI:從「會說」到「會做」
今年年會新增的重量級主線,而且是從四個完全不同的產業位置同時逼近。
你即便 ChatGPT 可以告訴你怎麼騎腳踏車,事實上它是不知道什麼是騎腳踏車的。魏士鈞 · 瑞昱半導體
三大成本障礙
廣運陳智杰引 NVIDIA 說法,並提煉成口號「無三貴」:
| 障礙 | 現況 |
|---|---|
| 資料貴 | 實際可用真實數據僅約 10%。 |
| 訓練貴 | 懂訓練的工程師稀缺且昂貴。 |
| 實體測試貴 | 單台人形機器人約 400 多萬元,訓練 20 台恐達數億元。 |
這就是數位孿生今年被大量提及的原因 —— 它不是為了「看起來很像」,而是為了同時降低這三項成本。四家公司(西門子、和碩、廣運、台達)從四個角度講同一件事,其中台達陳聖華給了最反直覺的結論:
量產的時候數位孿生能夠做的事情其實不太多 —— 如果你要看很像的,你就看實體就好了嘛;數位孿生真正派上用場的,其實是試生產的階段。陳聖華 · 台達研究院
學界集體質疑主流路線
| 講者 | 質疑 | 替代方案 |
|---|---|---|
| 魏士鈞 · 瑞昱 | 高階 System 2 系統必然有幻覺;雲端大腦太耗電。 | 台灣做 System 1 —— 可硬體化的感測—致動反射迴路。 |
| 孫紹華 · 台大電機 | 神經網路 policy 只是死記硬背。 | Program-Guided Robot Learning。 |
| 陳奕廷 · 陽明交大 | 忽略使用者真實需求與情境化安全驗證。 | Human-centered physical AI。 |
孫紹華的迷宮實驗是最漂亮的反例:深度強化學習 agent 在 8×8 迷宮訓練到能完美解任意佈局,看似學會了「右手定則」;但換成更大的迷宮就完全失效。而程式合成產出的 policy,寫出來的就是右手定則本身,可泛化到任意大小迷宮。
六、算力回流地端:成本、資安、主權的三重驅動
2023–2024 年的預設答案是「先上雲」。2025 年,這個預設被三個獨立的力量同時鬆動。
成本
思科盧佳成給了一個具體的損益兩平點 —— 以每分鐘 250 個推理請求估算,約 1.5–2 年地端建置成本即可打平雲端 token 成本。他同時提到 Cisco 內部 AI 推論流量每月成長約 40%、年成長 46 倍,而每個 agentic engine 平均對語言模型有 8–14 次重複確認請求 —— agent 架構本身就是 token 放大器。
資安
AI 安全論壇上英業達陳維超指出,企業真正的風險是員工把機敏資料貼進外部平台;資安院龔化中則把地端與雲端的取捨拆成完整清單,並提出混合部署(敏感資料留地端、其餘上雲)為務實解。
主權
聯發創新基地陳宜昌整理的四個理由(成本、資安、系統穩定性、可調整性)中,「系統穩定性」是最少被討論但最實際的一項 —— 不受第三方 API 版本汰換影響。
七、AI 安全的重心位移:從「模型會不會失控」到「人會不會亂用」
今年 AI 安全的討論出現了明顯的分層,四位講者各自認定的「最大風險」完全不同 —— 而他們都是對的,只是站的位置不同:
| 講者 | 位置 | 認定的最大風險 |
|---|---|---|
| 龔化中 · 國家資通安全研究院 | 技術攻防 | 模型與系統的攻擊面:提示詞注入、越獄、資料投毒、MCP 工具中毒。 |
| 陳維超 · 英業達 | 企業實務 | 不是模型 —— 是員工把訂單價格貼進外部聊天機器人。 |
| 邱維辰 · 陽明交大/國科會 | 政府治理 | Agentic AI 自主失控與軟體供應鏈風險;法規遠遠落後。 |
| 紀懷新 · Google DeepMind | 研發本質 | 安全性是 A × B × C 而非 A + B + C。 |
紀懷新那句話是本屆最重要的技術洞見之一:大型語言模型具備 compositionality,多個能力組合後會產生新的湧現能力,因此安全性是相乘而非相加。這意味著傳統「divide and conquer」(A 安全+B 安全+C 安全=整體安全)的系統安全思維在 LLM 上直接失效。
務實派的答案(陳維超)也值得記:他分享的不是「禁止員工用 ChatGPT」,而是設置 warning trigger —— 不監聽全部對話,只在偵測到疑似機敏資料外送時發出警示供事後稽核。這是承認「員工一定會私下用外部工具」之後的設計。
攻擊面也在變
龔化中提到針對「AI 瀏覽器/AI 助理」而非人類使用者的新型詐騙,已有專有名詞 Scamlexity 描述。他也提到 AI 讓 ransomware 製作時間從約一週縮短到約 20 分鐘、軟體漏洞挖掘從數天縮短到約 1 小時;而防守方同樣在用 AI —— DARPA AIxCC 於 2025/8/8 在 DEF CON 33 公布決賽結果,用 AI 自動找漏洞。
八、人機協作定型:hybrid 成為預設答案
橫跨六個產業的落地案例,沒有任何一家宣稱要用 AI 全面取代人力。這不是政治正確,而是工程結論:
| 公司 | 做法 |
|---|---|
| 91App | Rule Engine + AI + 人工的三層混合。 |
| 雄獅旅遊 | AI 產出 → 人工審核 → 再審核 → 再校正。 |
| 和碩 | 人做 supervisory control,AI 做細節執行。 |
| 台達 | 生成式 AI 先做到 85%「大致正確」建立信任,才接受其餘 10–15% 的創新設計。 |
| 台灣體育運動大學 | 超音波 AI 不能診斷(醫事法限制),只能篩選影像給醫師判讀。 |
和碩蕭安助引 1978 年 MIT 論文(潛水載具遠端遙控研究)提出的 supervisory control 概念,是今年最好的理論框架:直接遠端操控會遇到 latency 問題,解方是人類只下達方向目標、設備自身處理細節控制。他把這個類比延伸到企業赴海外設廠的管理 latency —— 人 + AI 的協同監督控制。
不要忘記,最終最終還是人在做 supervisory control。蕭安助 · 和碩
選任務的方法論也成形了。蕭安助引 Stanford「WorkBank」論文的兩軸法:
技術可行性
↑
│ 研發區 綠區
│(等技術成熟) (立刻做)
│
└──────────────────→ 人是否想要 AI 幫忙有趣的發現:人最想要 AI 代勞的是安排客戶預約、維護檔案、格式轉換;最不想要 AI 介入的多是創意型工作(編輯、排版)。
九、台灣的驅動力不是降本,是缺工
這是台灣場域與國際論述最不一樣的一點,而且它在多場演講中重複出現:
- 陳正然(政策論壇) — 25–35 歲 AI 人才因少子化(出生人口從 40 萬降到 20 萬)與 M 型化結構性短缺;高齡化下需靠機器人與移工填補。
- 黃能富(陳昇瑋紀念講座) — 農業案例幾乎全部源於缺工:小黃瓜需一日兩採、蛤蜊分級需人工目視、軟性藥袋異物檢測需 20 人且要求視力 1.0。
- 黃信川(雄獅旅遊) — 導入大量 AI 後公司仍缺 500 人,目標是「用同樣 2,000 多名員工,把 300 億營收做到 600 億」。
- 林彥良(勤業眾信) — 台灣過去經濟紅利建立在優質且低成本的人力上,少子化下人力紅利消退,企業須尋找第二成長曲線。
- 盧佳成(思科) — 以「數位員工」(實體機器人 + 虛擬 AI system)回應缺工。
這個差異很重要:歐美論述的主軸常是「AI 會取代工作」,台灣現場的主軸是「沒有人可以被取代,因為根本找不到人」。這解釋了為什麼台灣的 AI 導入案例普遍是擴增(augmentation)而非自動化取代(automation),也解釋了為什麼人機協作在台灣不是折衷方案,而是唯一可行解。
你(的機器分級效率)如果沒有比我好,你就不用來了。蛤蜊農民對黃能富團隊說的話
目前機器單線每分鐘 600 顆,人工每分鐘 2800 顆。AI 還沒贏。
十、關於「台灣該做什麼」,業界沒有共識
這是把整場年會串起來最有意思的一條線 —— 幾乎每位重量級講者都回答了這題,而答案彼此衝突:
| 講者 | 主張 | 隱含的資源配置 |
|---|---|---|
| 施崇棠 · 華碩 | 算力 × 模型 × 應用三角優勢,建立可信賴的國家 AI 品牌。 | 全面投入,發揮 GPU 系統近 9 成市占的既有優勢。 |
| 魏士鈞 · 瑞昱 | 不做雲端大腦,改做大量便宜低耗能的「小腦」與反射神經。 | 押注半導體,放棄追趕大模型。 |
| 簡立峰 · 政策論壇 | 聚焦應用面全球領導地位,不打 foundation model 軍備賽。 | 政府帶頭用 AI、資料信託、全民普發 AI token。 |
| 陳正然 · 政策論壇 | 「只有兩個人可以救台灣:機器人跟外國人」。 | 資源投向自動化與移工/國際人才。 |
| 蔡明順 · AIA 閉幕 | 難成 AI 研發大國,但可成 AI 應用大國。 | Taiwan Inside 方程式:AI + D(domain)× T(Taiwan way)。 |
這些主張的分歧點在於「台灣要不要碰模型」:施崇棠說要(模型工程能力是三優勢之一),魏士鈞說不要(做 System 1 不做 System 2),簡立峰與蔡明順說繞過去(做應用)。
幾個支撐辯論的結構性數據(陳正然)
- 台股數年上漲近 3 倍、市值約排全球第 9,但台灣 GDP 全球排名僅約 20–21 名。
- 美國七大科技公司市值合計超過中國全年 GDP;Nvidia 市值超越英國 GDP。
- 台積電、聯發科、鴻海三家合計投資研發經費占全台可投資經費 90% 以上。
- 全球約 7,000 種自然語言中,主流 LLM 僅支援約 100 種 —— 繁體中文的「資用落差」風險。
政策不是在於哪些事應該做,而是在這些應該做的事情裡面,我們要用什麼樣的優先順序去做。侯宜秀,政策論壇開場
今年沒人再講的事
有時候「消失的主題」比「熱門的主題」更能說明產業位置。對照 2023–2024 年的常見議題,今年明顯退場的有:
| 退場的主題 | 為什麼 |
|---|---|
| 「什麼是 LLM/Transformer」的原理科普 | 假設聽眾已經懂了。唯一的入門框架(AIA 蔡政霖的廚房比喻)也是為了區分 Workflow/Agent/Agentic Workflow,不是解釋模型。 |
| Prompt engineering 技巧 | 被 Context Engineering 取代 —— 討論的層次從「怎麼寫提示詞」上升到「怎麼管理模型的記憶體」。 |
| 「AI 會不會取代工作」的焦慮論述 | 在台灣被缺工現實直接蓋過。 |
| 單純的 RAG 教學 | 被 Agentic RAG 取代 —— 不再在設計時寫死檢索流程,改讓 agent 中途主動查。 |
| 模型排行榜比較 | 被評測有效性的質疑取代。 |
如果只記三件事
1. 差距已經不在模型,而在流程。
四十幾場演講的共同結論:技術門檻大幅降低(vibe coding、開源模型、no-code 平台),瓶頸全部轉移到組織 —— 策略共識、流程盤點、人才轉型、由上而下的推動力。東豐纖維「阿旺不簽、經理不簽」、雄獅董事長「每場業績會議先報告 AI 用了什麼」,這種土法煉鋼的組織手段,今年被證明比任何技術選型都關鍵。
2. 接受第一版會爛,是所有成功案例唯一的共同前提。
91App 的 98% 覆蓋率/50% 正確率、雄獅的 ChatGPT 排遊程幻覺、和碩的 agent「試了就陣亡」—— 沒有一個成功案例是一次到位的。真正有效的做法是先放上去、發現爛、加規則、再迭代,並且在系統裡內建防呆與持續校準機制(如 91App 獨立於對話流程外的 Evaluator)。
3. 台灣的 AI 命題是「找不到人」,不是「省成本」。
這決定了台灣該優先做的不是裁減型自動化,而是擴增型人機協作與知識傳承(老師傅經驗數位化、跨國工廠知識共享、實作型人才培育)。也因此,黃能富的 AI Maker 與跨校算力共享聯盟、AIA 的分級認證與北中南區域中心,在今年年會裡的份量不亞於任何一場技術演講。
資料來源
本頁為跨場次綜整。文中引用的外部資料來源: