這頁是怎麼比的
這一頁把本站的九月筆記,對照另一份獨立整理的 2025 Generative AI 年會筆記來讀 —— 那場年會辦在 2025 年 5 月 23–24 日。兩份都是現場記錄、事後查證的筆記,查不到的一律標明,不補寫。
與 2024 那一頁不同,這裡比的不是「隔年」。兩場年會在同一年舉行,差別不只是日期,而是本質:一個舞台對三廳平行、個人實作者對企業與學研機構、售票的兩天雙年會對基金會的年度大會。這裡不評高下,兩場本來就是為不同的房間辦的。
一、兩場年會的規模與形狀
房間的形狀,決定了後面大部分的差異。一場把所有人放在同一個廳、講者依序上台;另一場三廳平行,逼你選。單一舞台代表所有人聽到的是同樣那 24 場,所以節目表撐得起在一家銀行與 Google DeepMind 之間安排一位國小學童;三廳平行則代表無人機、政策與運動科學可以同時進行,而沒有人聽得完。
二、中間那三個半月,什麼動了
兩場年會之間隔了 108 天。這個間距短到工具、模型與大部分問題都還是同一批,卻也長到其中好幾項已經換了正負號。
- MCP 是剛取得共識的那一層反轉MCP 是 agent 準確率死掉的地方五月的兩天裡,這個協定出現了三次:一場完整的規格導讀、一位工程師把它接進自己的 coding agent、一家銀行把它列進下一輪規劃。到了九月,和碩引 Salesforce 研究指出 MCP 工具接得越多、準確率掉得越兇,部分場景僅剩 33%,資安場次則把 MCP 工具下毒列進攻擊面。
- 從「會回答你」到「會動手做」焦點位移Agentic AI 進入幻滅期案例其實沒怎麼變 —— 每天對帳、填表、自動開分支寫程式。變的是先講哪一半:五月先講被拿掉的那段雜事,九月先講失敗模式,並用自家數據佐證使用者「試了就陣亡」。
- 公開指標不夠用 —— 正確率與覆蓋率自己定義升級評測本身已經和商業可用性脫鉤五月的抱怨是「排行榜測不出我的產品能不能出貨」;九月 APMIC 逐篇分析 Gemma 3 官方引用的 34 篇評測,發現 80% 是選擇題,而商業實務幾乎都是問答題,篩出問答題型後 11 項中僅 4 項及格。
- 單一廠商的蒸餾產品線升級參數量不再是護城河五月只有 APMIC 一家,用中央廚房蒸便當的比喻講蒸餾,配一份四階產品梯。九月則有三組人各自帶著互補的數字抵達同一個結論:24B 在台灣法律垂直評測上打贏 120B,而 VRAM 需求只有五分之一;3B 的 function calling 超過 90 分;Breeze 2 在 50 個原本出錯的護照 OCR 案例上勝過 Gemini。
- 自建,因為客戶資料不能出去焦點位移算力回流地端,而且附上回本時間五月的驅動力是法遵,玉山的兩場用了同一句話。九月的驅動力變寬,而且有了數字:思科估以每分鐘約 250 個推理請求計算,地端建置成本約 1.5–2 年回本,另外還有資安、主權,以及不必受第三方 API 版本更迭擺布。
- 機器人的三個瓶頸,來自一場研究型 Keynote升級Physical AI,四個產業位置同時逼近五月的機器人是一場 Google Keynote 裡的一段投影片:泛化性、互動性、靈巧度。到九月已經是產業事實 —— 台積電在部分管路案要求交付 USD 資產、機器人供應商被要求交付 URDF —— 四家公司從四個角度講數位孿生的成本論證,三位學者則公開質疑主流路線。
- 一位講者建議台灣往哪裡看升級五位重量級講者對同一題給出互不相容的答案五月那場 Google DeepMind 的 Keynote 說台灣自 1990 年代起把資源押在晶片、因而錯過軟體浪潮,接著列出幾個不需要堆大量晶片的研究方向,現場沒有人反駁。九月「台灣到底要不要碰模型」變成貫穿整份議程的公開分歧。
- 整個壓軸段落給了 AI 影像退場議程上沒有五月用三場生成影像收尾:圖騙為什麼有效、生成任何一格之前該做完哪些構成工作、以及「誰有資格開始創作」。九月沒有創作端的影像主線,影像場次是醫療與工業檢測。
- 非工程師講自己的導入故事退場組織規模化,由管組織的人來講兩場問的其實是同一件事 —— AI 怎麼進到組織裡 —— 但從相反的兩端問。五月讓做雜事的人上台,九月讓握預算的人上台,帶著成熟度模型與成本論證。
三、同一批人,兩個場子
兩份議程加起來約七十人,其中三位在兩場都上了台。重疊很小,而這正是它有用的原因:同一個人在五月與九月講出不同的東西時,房間就是那個看得見的變因。
紀懷新 · Google DeepMind —— 兩場都是 Keynote
五月整場建立在「收斂」上:翻譯、摘要、問答這些原本各自獨立的系統被折進同一個模型,而同樣這股力量正延伸到機器人。他走過 Project Astra 的展示、點出機器人的三個瓶頸(泛化性、互動性、靈巧度),最後列出他認為台灣不需要堆大量晶片也能切入的方向:多步推理、實體工具使用、自我改進、多模態推理與個人化。他也直說台灣自 1990 年代起把資源押在晶片,因此錯過了軟體浪潮。
九月一樣的 Astra,換了框。九月回到第一性原理:搜尋與推薦三十年的 ranking 經濟、transformer 為什麼其實是「變壓器」,以及那個主張 —— next-token prediction 只是既有知識的聯想、不是 intelligence,真正的 intelligence 要能預測「思路」,所以訓練必須在輸入與輸出之間加進解釋與推理。還有那句後來被整場年會反覆借用的話:大型語言模型的安全性不是 A 加 B 加 C,而是 A 乘以 B 乘以 C,因為能力組合會長出新的能力。
李昆謀 · 91App —— 同一個案例,講了兩次
五月五月的年會主場,他以產品長的身分講電商上架案例:正確率與覆蓋率互相拉扯,最後導出人腦、規則引擎與 AI agent 的分工公式。那場有一半在講軟體開發本身 —— PRD 到底是寫給誰看的(如果讀的是 AI)、以及 300 人團隊配 300 個 AI 助理要花多少錢。
九月九月同一個案例回來了,軟體那半段拿掉,收緊成一個關於零售 agent 的論證。它多了一個五月沒說出口的成效倍數(效率提升 10 倍)、多了一句「規則引擎直接跑 CPU、完全不用 AI」、多了一套具名架構(評分器刻意獨立在對話流程之外),還多了 GEO —— 讓別人的 agent 找得到你 —— 作為下一個要煩惱的事。
吳柏翰 · APMIC —— 先是建設面,後是破壞面
五月五月完全是建設面。他用中央廚房蒸便當解釋蒸餾,講把 TB 級的企業知識壓進一個 6GB、可以直接對話的模型,攤開一份依資料量與預算分四階的產品梯,並在台上開源三樣東西:繁體中文推理資料集、一套評測工具,以及一個整合 MCP 的蒸餾 3B 推理模型。
九月九月則是拆除。他逐篇檢視 Gemma 3 官方引用的 34 篇評測,指出 80% 用選擇題題型,而商業實務幾乎都是問答題;篩出問答題型後,11 項中僅 4 項及格。他的結論是產業必須自建評測標準,不能接受廠商拿通用評測宣稱「這模型很強」。
水的深度不能用磅秤來秤。APMIC 吳柏翰 · 九月 —— 距離他五月在台上開源一套評測工具,四個月
五月開源的東西沒有留在五月。九月 Twinkle AI 創辦人 —— 同時是 APMIC 的 AI 工程總監 —— 在 Lightning Show 上提出:一個 3B 模型在含 MCP 的 function calling 評測拿到 90 分以上、高於 GPT-4o;而 TMMLU+ 之所以要含台灣國考題庫來自建,正是因為通用英文評測測不出繁中場景能不能用。五月在一個舞台上宣布的產出,九月變成另一個舞台上的證據。
四、同一個專案,三種講法
91App 的電商上架自動化流程,是這兩場年會裡被講最多次的案例:五月講了兩次(開發者日的首席架構師、年會主場的產品長),九月又講了一次。同一個專案在三個半月內被講三遍,這種材料難得,所以直接攤開來對。
| 開發者日 · 5/23 | 年會主場 · 5/24 | 九月 · 9/9 | |
|---|---|---|---|
| 第一版 | 正確率 52.3%、覆蓋率 87% | 正確率 45%、覆蓋率 98% —— 與標準答案有 7,500 處不一致 | 欄位全填、覆蓋率 98%,正確率僅約 50% |
| 加「無信心不打」規則後 | 正確率 90% 以上、覆蓋率 50% | 正確率 90%、覆蓋率 50% | 正確率 90%、覆蓋率 50% |
| 第三步 | 未提及 | 要求每個欄位寫出理由,讓審查者可以直接攻擊推理,而不必逐項重算 | 要求每個欄位寫理由 —— 正確率再升 |
| 最終分工 | AI 與人各半 | 規則引擎 40、AI agent 50、人工 10 | Rule 40% + AI 50% + 人工 10%,規則引擎直接跑 CPU、不用 AI |
| 成效數字 | 工程師跑分驗證時間:四小時壓到十分鐘 | 人工填寫:15,000 欄位、每欄約 10 秒 —— 15 萬秒、2,500 分鐘、41 小時,約五個工作天 | 效率提升 10 倍;同樣的 15,000 欄位、2,500 分鐘,寫成約 11 工時/週 |
三次講法的終點是穩定的:40 / 50 / 10 的分工沒有變,底下那條原則也沒變 —— 覆蓋率可以談,正確率不能。晃動的是起點的數字,而那本來就可能來自不同的評測輪次或抽樣批次。這裡兩組都列,不做裁決。
五、只有五月那場才有的
下面這些不是九月講得比較少,而是九月根本沒有。每一項都可以從「誰在現場」推出來。
| 只在五月 | 當時的樣子 | 為什麼九月沒有對應 |
|---|---|---|
| AI 影像的兩張臉 | 壓軸三場。一場主張圖騙能不能騙到你,跟它看起來多真沒什麼關係,而是看它有沒有打中你的立場、情緒、知識缺口與社會信任;另外兩場主張決定生成影片好壞的是「生成第一格之前」的構成工作,以及真正被改變的是「誰有資格開始創作」。 | 九月的議程沒有創作端的影像主線,影像相關內容是醫療影像與工業瑕疵檢測 —— 同一批模型,不同的問題。 |
| 非工程師的第一人稱路徑 | 一位廣告業務從兩小時做出的 LINE 問答機器人開始,一年後做出附儀表板的專案管理系統;一位基金會秘書處工作者在女兒起床前的清晨時段,每一兩週出一個小幫手,累積三十多個;一位國小學童用四個免費版模型,把六個月的學習曲線壓到一個月。 | 九月的組織主線是從管理端講的 —— 成熟度模型、變革方案、講給董事會聽的成本論證。做雜事的那個人是被描述的對象,不是台上的人。 |
| 把一份規格從頭走到尾 | 一整場講 MCP 規格,並坦白哪些還沒好:遠端部署與認證都還在補,細到哪一版除錯工具有 bug、要降回哪一版。 | 九月不停提到 MCP,卻沒有一次是當成規格在談,只當成成本(工具數 vs. 準確率)與攻擊面。 |
| 把個人自動化當正經內容講 | 整整一場講把個人雜事交給 n8n,主軸是「人生變得更廢了」。 | 沒有對應的東西。九月的流程自動化是企業流程,後面接一張投資報酬率的投影片。 |
| 把「等」當成一種策略 | 策展人的第三種策略就叫「躺平」:如果一件事現在對模型有點勉強,與其花力氣教它,不如再等一季。 | 九月沒有人主張等。台上每一位都在交代一筆已經付過錢的導入。 |
六、只有九月那場才有的
反過來的清單比較長,這多半只是三廳對一廳的結果。更值得注意的是這些主題的重量:幾乎都與實體、法規或國家層級的規模有關。
| 只在九月 | 當時的樣子 | 為什麼五月沒有對應 |
|---|---|---|
| 數位孿生變成供應鏈事實 | 整條主線背後是三項成本障礙 —— 實際可用的真實資料僅約 10%、懂訓練的工程師稀缺且昂貴、單台人形機器人的實體測試約 400 多萬元。底下還有一個訊號:台積電已在部分管路案要求交付 USD 資產,機器人供應商也開始被要求交付 URDF。 | 五月的機器人內容只有一場 Keynote 的份量,而且是當成研究瓶頸講,不是當成交付規格。 |
| 無人機與具身智慧 | 兩場 Keynote 其中一場給了無 GPS 環境下的飛行,某一廳整個下午都是無人機與具身智慧,反覆出現的關鍵字是供應鏈去風險與開放標準。 | 五月完全沒有。 |
| 台灣路線之爭 | 五位重量級講者對同一題給出互不相容的答案 —— 台灣到底要不要碰模型。一邊是算力 × 模型 × 應用的三角優勢,一邊是做可硬體化的反射迴路、不做雲端大腦,政策論壇與閉幕則主張繞過去、把應用做好。 | 五月有一位講者針對同一題給了建議,沒有人反駁。單一舞台不會產生對撞,只會產生順序。 |
| 政策與法規 | 政策論壇談的是優先順序而非方向 —— 政府帶頭成為最會用 AI 的政府、建立資料信託制度、全民普發 AI token;《人工智慧基本法》在年會期間仍在審議,2025/12/23 才三讀通過。 | 五月沒有政策內容,最接近的只有一句關於台灣歷史資源配置的評論。 |
| 資安攻防 | 拆解 OWASP LLM Top 10 與越獄三策略、一種瞄準 AI 瀏覽器而非人類使用者的新型詐騙、AI 把勒索軟體撰寫從約一週壓到約 20 分鐘,以及 DARPA AI Cyber Challenge 的決賽結果。 | 五月唯一的資安框架是法遵 —— 客戶資料不能離開這棟樓。 |
| 缺工作為第一驅動力 | 出生人口從 40 萬降到 20 萬、25–35 歲人才結構性短缺;一家旅遊公司在大量導入 AI 之後仍缺 500 人;還有一位蛤蜊農的標準 —— 人工每分鐘 2,800 顆,機器單線 600 顆。 | 五月談的是每個人省下的時間 —— 半小時壓到一分鐘 —— 從來沒有談到國家層級的缺人。 |
| 學界的反對意見 | 一個迷宮實驗:深度強化學習代理解得開所有 8×8 佈局、看起來學會了右手法則,換成更大的迷宮就完全失敗;而合成出來的程式策略字面上就是那條法則,任何尺寸都能泛化。另有一條主張認為主流路線忽略了真實情境下的安全驗證。 | 五月的研究端聲音只來自一間業界實驗室,沒有一個可以被反對的立場。 |
七、兩個房間各自得到的同一個結論
兩份議程重疊得很少 —— 約七十人裡只有三位共通 —— 所以它們落在同一個點上的地方,比任何單一場年會的主張更有份量。下面這五項,是五組不同的人撞到同一面牆。
| 兩邊的共同結論 | 五月 | 九月 |
|---|---|---|
| 覆蓋率可以談,正確率不能 | 寧可覆蓋率低,也不要正確率低 —— 由三個位置各自提出:首席架構師定義指標、產品長把它變成分工依據、研究者指出評測決定了大家要爬哪座山。 | 同一條原則從失敗端抵達:一個把每個欄位都填滿、卻錯一半的 agent 幫不上任何人的忙,因為每一項還是得重新檢查一遍。 |
| 瓶頸在評測,不在能力 | 一位講者兩年前為繁中模型設計的整套題目,各家幾乎都解掉了,公開評測正在快速失去意義 —— 而模型用正確率換討好,被指為結構性問題。 | 廠商自己的引用清單被逐篇檢視,發現 80% 是選擇題;而含台灣國考題庫的在地評測之所以要自建,正是因為通用英文評測測不出繁中場景的可用性。 |
| 卡住的是組織,不是模型 | 一家銀行第一次導入 AI coding 工具直接失敗 —— 工具買了,什麼都沒變;行內聊天平台上線後只有 17.8% 的人用過、單日使用率 2.1%。另一個團隊乾脆把技術放到一邊,把 AI 藏進大家原本就在用的介面裡,讓沒有人需要「決定開始用 AI」。 | 講得最系統的版本是:資料與技術平台不是該擔心的部分,策略、流程與人才是。這與前兩年「先把資料整理好」的正統說法明顯決裂。 |
| 人留在迴圈裡是設計,不是膽小 | 人要當一個好的客戶,而好客戶懂得怎麼下需求、怎麼驗收。有位工程師的工單表單刻意顯示偏高的單次執行成本,逼提需求的人把需求講清楚。 | 同樣的結論繞道 1978 年一篇談遙控潛水器的論文得出:直接遠端操作會遇到延遲極限,所以由人下方向性的目標、設備處理細部控制。六個落地案例,沒有一家宣稱要用 AI 取代員工。 |
| 地端重新成為真的選項 | 開源模型的效能與推理能力長上來了、推理硬體的選擇變多、成本變得可以承受 —— 而法遵是最後那一推:客戶資料不能出去,所以自建。 | 同樣的結論,但附上了回本時間,並多了一個觀察:每個 agentic engine 平均對模型有 8–14 次重複請求,agent 架構本身就是 token 放大器。 |
八、五月留下的未解問題,拿九月現場來對
五月那份筆記收在五件那一屆沒解決的事。三個半月當然不足以解決任何一件,但足以看出產業把哪幾件撿了起來、又從哪幾件旁邊走了過去。
- 現場印證 · 2
- 部分處理 · 1
- 仍未解 · 1
- 無人接手 · 1
- 現場印證評測的成本會左右研究方向這在九月成了整場年會最原創的一條主線:廠商官方引用清單被逐篇檢視,發現 80% 是選擇題、而商業實務是問答題;含台灣國考題庫的在地評測被自建出來;結論則是產業必須自建標準。
- 現場印證企業案例的成效數字很難從外部驗證沒有變,而且在更大的規模上更明顯:警示帳戶偵測人力減半、上架效率提升 10 倍、庫存分析從兩個月縮到兩三天、IRB 會議紀錄從 72 人時降到約 2 人時。每一項都是講者自述,沒有外部稽核。
- 部分處理MCP 的遠端部署與認證還沒補完它以資安問題而非工程問題的形式回來了:資安場次把 MCP 工具下毒列進模型與系統的攻擊面,與提示注入、越獄、資料下毒並列。九月台上沒有人走過那份規格。
- 仍未解agent 之間怎麼互通 —— MCP 解決了模型接工具,agent 接 agent 還沒有共識仍然沒有共識,而且問題往下掉了一層而不是往前走:九月的發現是 MCP 工具接越多、準確率掉越兇,這讓 agent 之間的組合比五月看起來更難,而不是更容易。
- 無人接手識讀跟不上生成 —— 一般人分辨真假的方法幾乎沒有進步九月的議程完全沒有這一項。公眾媒體識讀不是產業年會的題目 —— 而這正是五月那份筆記指出的缺口:這個問題沒有一個房間認領。
九、兩場年會的主題涵蓋對照
整個對照的一張總表。這裡評的是每個主題在該場年會自己的趨勢綜整裡佔多少份量,不是它在會場上被說了幾次。
| 主題 | 五月 | 九月 |
|---|---|---|
| Agent 落地 | 主線:獨立成節 | 主線:獨立成節 |
| MCP 與協定層 | 主線:獨立成節 | 有記錄,但附屬於其他主線 |
| 評測有效性 | 主線:獨立成節 | 主線:獨立成節 |
| 小模型與蒸餾 | 主線:獨立成節 | 主線:獨立成節 |
| 地端與雲端部署 | 主線:獨立成節 | 主線:獨立成節 |
| 主權 AI 與繁中模型 | 有記錄,但附屬於其他主線 | 主線:獨立成節 |
| 推論成本與硬體策略 | 有記錄,但附屬於其他主線 | 主線:獨立成節 |
| AI 輔助軟體開發 | 主線:獨立成節 | 有記錄,但附屬於其他主線 |
| 組織導入與變革 | 主線:獨立成節 | 主線:獨立成節 |
| 人機協作 hybrid | 主線:獨立成節 | 主線:獨立成節 |
| 非工程師的 AI 導入 | 主線:獨立成節 | 未出現在該場年會的趨勢綜整 |
| 個人流程自動化 | 主線:獨立成節 | 未出現在該場年會的趨勢綜整 |
| 影像與影片生成 | 主線:獨立成節 | 未出現在該場年會的趨勢綜整 |
| 媒體識讀與圖騙 | 主線:獨立成節 | 未出現在該場年會的趨勢綜整 |
| 機器人與具身智慧 | 有記錄,但附屬於其他主線 | 主線:獨立成節 |
| 數位孿生/OpenUSD/URDF | 未出現在該場年會的趨勢綜整 | 主線:獨立成節 |
| 無人機 | 未出現在該場年會的趨勢綜整 | 主線:獨立成節 |
| 資安攻防 | 未出現在該場年會的趨勢綜整 | 主線:獨立成節 |
| AI 治理與法規 | 未出現在該場年會的趨勢綜整 | 有記錄,但附屬於其他主線 |
| 缺工作為驅動力 | 未出現在該場年會的趨勢綜整 | 主線:獨立成節 |
| 台灣路線之爭 | 有記錄,但附屬於其他主線 | 主線:獨立成節 |
- 主線:獨立成節
- 有記錄,但附屬於其他主線
- 未出現在該場年會的趨勢綜整
一句話版本
五月那場年會在講「一個人現在做得到什麼」;九月那場在講「一個產業還是做不到什麼」。
中間那三個半月並沒有讓工具變多少,變的是計量單位:五月的成果用一個人的下午來算,九月用回本年限、人力編制與供應鏈要求來算。兩個房間得到了同樣幾個工程結論 —— 覆蓋率可以談、瓶頸在評測、卡住的是組織、人要留在迴圈裡 —— 而兩邊都沒聽見對方說出口。