01 · 紀懷新 —— Google DeepMind

【KEYNOTE】智慧個人助理的未來世界

從 Google 搜尋/推薦系統三十年的「ranking 經濟」出發,說明 sequential transduction、chain-of-thought、post-training 三個概念如何讓大型語言模型從「文字接龍」進化為具備 reasoning 能力的個人助理,並以 Project Astra 展示這個未來。

  • Information Retrieval 兩大基石 — indexing(把 keyword 對應到文件位置)與 vector space model(以字詞頻率分布做 cosine similarity)。這兩個概念奠定了 Google 搜尋引擎的基礎。
  • Indexing、vector space model 與 neural network 共同支撐起 1995 年以來每年超過 5000 億美元的網路經濟 — Google 搜尋約 $200B、YouTube 約 $50B、Facebook(含 IG)約 $130B、TikTok 約 $130B。核心運作模式是 ranking/sorting,而非生成式 AI。
  • 為什麼叫 transformer — 中文正確翻譯是「變壓器」,因為它和麥克風、喇叭、耳膜一樣是 transducer:把一種 energy wave(或 information sequence)轉換成另一種。這就是 sequential transduction。
  • 關鍵論文時間軸 — 2014/12 Sequence to Sequence Learning with Neural Networks(Sutskever/Vinyals/Le),用 RNN、複雜度 O(n),英翻德達到 SOTA,2025 年獲 NeurIPS Test of Time Award;2017 年 Transformer 論文改用 matrix computation(O(n²)),精準度更高但算力需求更大,本質是 scaling up;2022/1 發表可用同一套模型做 chatbot 的論文(講者掛名),同月發表 Chain-of-Thought 論文;2022/2 發表 post-training 論文。
  • Chain-of-Thought 的概念來源 — 其核心 schemata(學習理論中的分步驟解題模式)是他當年替母親校對博士論文時學到的,近 30 年後才用進這篇論文。
  • 推動單一多語模型的瓶頸 — 2015 年 Google 翻譯團隊僅 200-300 人,要支援 40 種語言兩兩互譯需建置 1,560 個獨立模型。
  • 什麼是真正的 intelligence — next-token prediction(大腦自動完成句子、Paris → 艾菲爾鐵塔)只是既有知識的聯想,不是 intelligence。真正的 intelligence 要能預測「思路」(thought pattern),因此訓練需要在 input-output 之間加入 explanation/reasoning。next token prediction + chain-of-thought + post-training 才是「推理革命」的三要素。
  • Project Astra 展示 — 修單車情境(AI 讀說明書、找 YouTube 教學、翻信箱找零件規格、致電腳踏車行問庫存、記得使用者的狗叫 Zooka 而推薦狗籃);視障吉他手案例(讀告示牌 Wi-Fi 密碼、定位麥克風架)。講者提及影片是現場手機/智慧眼鏡即時 run Astra,而非事先錄好的廣告。
  • 團隊現階段焦點 — multi-step complex reasoning、tool use、synthetic data generation、multi-modality integration,以及 personalization:General intelligence is not enough, we want intelligence that's built for you。
Large language model 事實上是一個 wrong term,因為它不是只是為了語言而生 —— 我們真正想要做的事情是 reasoning。
That's not intelligence. That's just next token prediction.
焦慮是對未來的無知 —— 你沒辦法 predict 未來,才會有這種感覺。

02 · 程登湖 —— 陽明交大/創未來科技

【KEYNOTE】人工智慧驅動的無GPS環境無人機

展示如何用雷達、攝影機與 IMU 等多感測器融合,讓無人機在完全沒有 GPS、沒有通訊訊號的戰場環境下,仍能自主偵測、識別、攔截來襲的敵方無人機(軟殺/硬殺),並延伸至無 GPS 導航競賽與室內倉儲自動化應用。

  • 情境設定 — 若無任何防禦設備,肉眼在約 400 公尺發現來襲無人機、對方以時速 100 公里推進,僅剩約 25 秒反應時間(若確認掛有炸藥則僅剩約 15 秒);有雷達+高倍攝影機可在 5-6 公里外發現。
  • 無 GPS 像閉著眼睛找出口 — 好一點的機型會懸停待電力耗盡墜落,差的直接失控墜落。單靠 IMU 積分定位,約 40 秒內誤差即可累積到上百公尺(指數發散)。
  • 純視覺定位可部分緩解,但沒有 global map,只能在走過的地方定位;群飛需靠彼此交換相對位置更困難。烏克蘭戰場經驗顯示:可用機載視覺特徵比對離線 local map(如衛星圖)做 relocalization,誤差約 20 公尺;另一常用方案是光纖即時傳輸影像給人員遙控。
  • 軟殺系統四元件 — 雷達(大範圍搜尋 5-6 公里,反射截面小的小型機難偵測故需小型雷達)、攝影機(3 公里內可 identify,但視角僅 2°,相對雷達 120° 極窄)、jammer(干擾 GPS/通訊,射程約 4-5 公里)、sensor(截收操作者遙控訊號輔助定位)。
  • 多感測器線上校正 — 客戶可能任意部署雷達/攝影機,無法出廠前對齊。團隊把雷達與多台攝影機間的 3D 相對位置與旋轉角校正從 2 小時縮短到 15 分鐘,角度誤差由 45° 降至 1° 以內。
  • 一個有趣的意外 — 外場測試誤把「老鷹」判讀為 drone(訓練資料未涵蓋鳥類),意外啟發「機場驅鳥」商業應用構想:用雷達+攝影機辨識鳥種後,播放該鳥種害怕的聲音驅趕。
  • 2025 年 4 月無 GPS 導航國防競賽 — 全台約 20 隊報名、6 隊晉級決賽,僅 2 隊在 GPS 被干擾後仍能成功飛行(多數隊伍失控亂飛,甚至有一台撞上鄰近醫院,幸無人傷亡)。講者團隊飛行約 13 分鐘、6 公里,定位精準但因規則要求使用國產約新台幣 1 萬元等級相機、解析度受限而多次目標類別誤判,最終獲「潛力獎」10 萬元,與第一名 150 萬元相差 15 倍。
  • 攔截機設計 — 全程無 GPS、無通訊,僅靠機載 seeker(RF 或 EO)自主追蹤、識別敵我、決策攔截;因重量限制常採 seeker 與機身剛性固定設計,故必須確保目標全程維持在視野內,牽涉加速度與慣性的精密控制器設計。實驗展示全自主攔截機成功命中人為遙控的目標無人機,最近距離可達 1 公尺內反覆測試。
  • 燈光秀與防禦 swarm 的技術本質差異 — 燈光秀可事先離線規劃路徑、只需同時起飛即可斷通訊運行;防禦 swarm 則須即時偵測、協調避障,只能做 peer-to-peer 邊緣通訊(無法連 cloud)。
偵測方式距離備註
肉眼約 400 公尺
攝影機(30 倍變焦,約 10 萬元)約 3 公里視角僅 2°
雷達約 6 公里成本約為攝影機的 5-10 倍;視角 120°
如果無人機沒有 GPS,就像是閉著眼睛,然後要你找出口出去。

03 · 論壇 —— 人工智慧安全實踐

三位與談人分別從「模型研發端」「企業應用端」「政府治理端」拆解 AI 安全的現實風險,並一致認為根本解方在於「人才互通」與跨領域的社會信任建立。

第一輪:各自最擔心的風險

  • 紀懷新 — 回憶 2022 年 Bard「100 天衝刺」:當時 LaMDA 團隊僅 3-5 人,訓練資料混雜 Reddit/PTT 一類酸民言論,導致早期聊天機器人「sensitivity 不夠好」,內部曾引發軒然大波,且擔心讓 CEO 被叫去美國國會聽證。他指出 AI 安全最難之處在於它並不 universal:醫療、金融、教育、製造業所需的安全準則完全不同,難以一套標準通吃。
  • 陳維超 — 主張企業視角應把「一般資安」與「AI 本身的安全」放在一起看,核心仍是資料庫被駭、帳號被盜等傳統資安問題;並提及 IT/OT 落差(產線設備旁的 Windows 系統可能十年未更新)。他認為目前企業內 AI 模型本身帶來的風險有限(多數場景下模型「像放在黑盒子裡」,尚未直接連結到 embodiment/機器/按鈕),真正的風險是員工把公司機敏資料(如訂單價格)直接貼進 ChatGPT/Gemini 等外部平台。
  • 邱維辰 — 歸納三大核心風險:隱私與資安(Agentic AI 常用的 MCP 因入門門檻低、以自然語言描述工具功能,容易被植入惡意指令,且 agent 自動運作時使用者往往「無感」;軟體供應鏈相較硬體更缺乏審查機制);失控風險(Agentic AI 依 chain-of-thought 自主 planning 並執行,可能走出使用者預期或可介入範圍之外);法規遠遠落後技術。他也指出現行事實查核多仰賴跨來源交叉比對(近似 majority voting),隨生成內容量暴增,此方法「很快就會失效」。

第二輪:安全 vs. 創新速度的取捨

  • 紀懷新 — 主張 exploratory 優先:「Let's find out what the possibilities are」,先充分了解模型能力邊界再處理安全。現在迭代速度太快,從「探索」到「產品上線」可能只剩幾週而非幾年;Google 內部作法是先大量開放給員工做 red teaming 快速找出問題,再與社會溝通「我們了解你的焦慮,但你不知道 possibility 就會更焦慮」。
  • 陳維超 — 被問及如何說服高層 AI 安全投資的 ROI,他表示任何投資本就難以直接對應獲利,AI 並無特殊之處。提出「diffusion → downstream」框架:多數企業仍卡在擴散使用階段(員工是否真的用公司核可工具),之後才會遇到使用後果問題(如 AI 寫錯報價 email 給客戶)。AI 安全投資邏輯應與一般資安投資類似(走 CSO 體系),並應把 security 與 trust/privacy 的問題分開看待。

第三輪:政府角色

  • 年初 DeepSeek 事件促使數位發展部、國家資通安全研究院緊急動員驗證風險並訂定使用規範,卻也暴露政府在「AI +資安」複合能力上明顯不足 —— 資安院組成多為傳統系統資安人才,AI 能量仍待補強。政府不可能包辦一切,須借力民間。
  • 對立法的看法 — 法律是「社會秩序的最後防線」,立法程序太慢、跟不上技術演進;現階段務實做法是先在高風險領域訂「底線」式立法,其餘用軟性指引。除了 exploration,關鍵領域更需要 exploitation:理解 AI 為何做出特定決策、其後果為何。
  • 政府可著力三方向 — 與產業協作提供資料治理與資安工具的框架與經費支持,扶植「AI 安全」產業生態;建立透明度與責任歸屬鏈的可追溯機制(未來政府單一入口若由 AI agent 自動執行跨部會查詢,需替每個 agent 建立專屬 identity 與存取入口);把 AI 安全意識教育落實到公民教育層面。

第四輪:人才與教育

紀懷新在這一輪的發言是全場最銳利的技術論點。舊系統思維是「divide and conquer」:A 安全+B 安全+C 安全=整體安全。但大型語言模型具備 compositionality,多個能力組合後會產生新的湧現能力(如翻譯能力+摘要能力組合出新能力),因此安全性是相乘而非相加。安全分析遠比過去複雜,人才培育需傳遞這種思維轉變,而非只教技術。

  • 陳維超的兩層做法 — AI literacy(教育員工如何正確使用工具,至少要教「送出的 query 永遠會被記住」)與 abstraction(架設公司核可的內部系統作為「牆」,同時務實承認員工仍會私下使用外部工具)。他分享的試行做法:設置 warning trigger,不監聽員工全部對話,而是當偵測到疑似機敏資料被送往外部大型模型時發出警示,供事後稽核。
  • 邱維辰 — 點出「有 AI/資安專長者不願進入個別產業」與「產業從業者缺乏 AI/資安能力」兩邊人才互不流通,政府可扮演媒合角色;主張產學合作應把真實產業問題帶進校園(聯合實驗室、企業實習),避免學界習慣把問題簡化成熟悉的演算法形式而脫離實務。特別呼籲學界應更 open-minded 接納無 PhD 但具強實作能力的人才,並讚許陽明交大延攬黃敬群(Jserv)的案例;同時揭露政府曾釋出約 80 個資安專案教師名額搭配加碼薪資,實際到職率僅約 25%,主因是部分系所反而用更高標準篩選申請者。
大型語言模型的安全性不是 A 加 B 加 C,而是 A 乘以 B 乘以 C。紀懷新,談 compositionality
法律是社會秩序的最後防線。邱維辰

04 · 黃致豪 —— 台灣體育運動大學

Moneyball 2.0:大模擬時代AI優化運動

用無標記點(markerless)3D 動作捕捉、OpenSim 肌骨模擬與超音波 AI 輔助判讀,量化投手動作、預防運動傷害,並協助青棒與職棒選手訓練。

  • 為什麼從情蒐轉向 — 情蒐對比賽結果是「乘數效應」(約 ×0.9~×1.1),前面那個基本能力分數影響更大,因此轉向用動作訓練提升基本分數。
  • 為什麼要無標記點 — 傳統貼反光點式須讓選手脫到只剩內褲,且丟球超過時速 140 公里時反光點易脫落,導致動作失真、非自然比賽姿勢。實驗室改用每秒 1050 張、4–6 機以上多視角高速攝影機同步觸發,後端用姿態估計套件(MediaPipe、OpenPose、Apple Vision、RTMPose)抓關節點,再平滑濾波處理跳動雜訊。
  • 準確度 — 團隊 2024 年發表於 IEEE Access 的論文:無標記點 3D 關節重建準確度已達約 3 公分(與貼點式相比);2025 年進一步優化至約 2 公分。
  • OpenSim 三類分析 — 關鍵動作關節角度(如前腳落地時的肩膀外展角)、動力鏈缺損偵測(手肘過低導致出手時手臂異常後旋)、各關節受力分析用於傷害預防。
  • 最重要的傷害發現 — 選手出手後收尾階段的 UCL(Tommy John 韌帶)受力大於最大肩外旋時刻,這是肉眼無法察覺的風險。
  • 場邊即時系統 — 每球自動偵測關鍵角度是否落在常模範圍內,以紅/黃/綠燈標示(常模 50–100% 綠燈、超出 10% 黃燈、更多則紅燈),並用 AI 自動產生評語。
  • 超音波 UCL 輔助判讀 — 與台大醫院郭柏霖醫師團隊合作,AI 自動辨識肱骨、尺骨與關節間隙,抓取 UCL 分數最高的影像回傳骨科醫師判讀;AI 不能直接診斷(醫事法限制),只能篩選。已在平鎮高中試行,該學年度投手掛零受傷。
  • 硬體成本 — 側力板昂貴(60cm×60cm 約 60 萬、100cm×100cm 約 100 萬;台體大鋪設 10 公尺長側力板約 1000 萬)。團隊正研發微型應變感測地帶作為低成本替代方案。
  • 中老年應用延伸 — 加強足背屈肌與髖外展肌後,膝蓋平均受力可由體重 1.7 倍降至 1.1 倍。
很多運科的東西我們會看到 demo 做出來很漂亮,但是 lab ready 到 game ready 其實有非常長的一段路要走。
教練問你痛不痛,你永遠都不痛,永遠不會痛。形容選手為求上場而隱瞞傷痛的常態

05 · 胡敏君 —— 清華大學

融合感測器、AI和VR進行運動員訓練

以籃球為主要場域,展示如何用單一攝影機/手機做細粒度動作與熱點分析、以 AI 輔助人工記錄協作、以及用 XR/VR 打造平價的沉浸式戰術與決策訓練系統。

  • 平價化問題 — NBA 自 2012 年起在場館架設多台高懸攝影機,但台灣球隊多為租用場館(連地板 logo 都要拆裝,一場約 20 萬),難以複製。UWB 類定位系統約 300 萬/套;消費級 App(Home Court、Zap)常誤判事件(如把傳球誤判為投籃)。
  • 團隊做法 — 允許使用單一可移動的手機/相機,仍可即時辨識精細事件(上籃/擦板/灌籃等 fine-grained 動作分類)。已用於 T1 聯盟賽事,並與其既有人工標記系統(需 6 人同步標註)整合,做到「AI 先標、人工確認」的協作模式(AI 標記標示為 system predictive,方便事後校對)。
  • PTZ 自動跟拍相機 — 以模仿學習訓練演算法模仿專業攝影師運鏡邏輯(而非單純追逐移動最多的人群),可在場邊、角落等非正中視角仍穩定跟拍,並過濾場外閒雜人等干擾。
  • 3D Mesh 重建 + AR 特效 — 重建持球者的人體 3D mesh,讓 AR 特效精準貼合在特定球員身上。相較品牌小編手動用 Adobe 剪輯(十幾秒特效需約 6 小時),AI 可即時判斷 play 斷點與持球者身分。
  • 視覺注意力預測 — 與眼動追蹤眼鏡團隊合作收集觀眾觀賽時的眼動與畫面資料,訓練模型預測觀眾會關注哪位球員,藉此決定特效該加在誰身上。
  • 虛擬廣告置換 — 用 AI 估算畫面中每個像素的深度資訊,將看板廣告替換為虛擬 2D/3D 廣告,且可正確處理前後遮蔽關係。
  • 面向初學者的動作矯正平台 — 起源於疫情期間教練無法實體授課的需求。Web 平台讓學員上傳動作影片,教練標註/比對骨架。一次投籃動作(僅 1.5 秒)被拆解為近 20 個關鍵步驟的個人化 SOP,系統自動比對學員與教練模板的差異並生成報告。
  • VR 沉浸式戰術訓練 — 教練在平板上輸入進攻戰術路線,AI 依此生成對應的防守者移動軌跡(auto-regressive/transformer 類生成模型),再將雙方軌跡投入 VR 頭盔,讓球員以第一人稱視角體驗掩護時隊友讓出的空間感。近期已擴充為多人版本,教練端與選手端各有專屬 UI。
  • VR 決策訓練 — 將不同防守情境預錄或動畫化,球員須即時做出對應動作,系統可即時辨識近 20 種動作是否正確並要求重做。意外發現:因 VR 訓練迫使球員看不到球,賽後檢測發現受訓者運球能力普遍提升。
很多球員聽完戰術都以為他會了,他就在白板上看完硬把軌跡背起來,結果上場就發現根本跑不出來。因為場上會有真的人防守你啊,可是在戰術板上你只看到一個一個的點,而且還不太會動。

06 · 易志偉 —— 陽明交大

從CoachAI出發建構智慧羽球空間平台

自 2017 年國科會「精準運動科學計畫」羽球項目起步,開發球種辨識智慧球拍、TrackNet 羽球追蹤模型與逐拍微觀數據標記系統,並將技術延伸為可負擔的智慧羽球場館多攝影機平台。

  • 智慧球拍 — 使用嵌入球拍的 IMU 感測裝置;早期單純用慣性訊號判斷揮拍易誤判(如把同學間用球拍互打當成揮拍),因此改用聲紋辨識(球拍擊中球的聲音類似樂器共鳴)結合慣性訊號時間戳記,並以傳統機器學習做特徵工程(可萃取上百個特徵值)。目標是辨識球種與計算訓練量(如判斷是否完成殺球 100 顆或高遠球 50 顆)。
  • 智慧發球機 — 摩擦滾輪式機種(約 10 萬元)多為中國廠商製造,台灣代理商不願開放控制器介面,團隊自行逆向開發並替換控制板,改用無線網路遠端控制,已申請專利並在競賽獲獎。已用於「AI for Kids」高中生羽球訓練教學。
  • TrackNet — 先以網球(顏色鮮明、速度較慢)驗證深度學習可行性,成功後才挑戰羽球(小物件、極高速、視覺特徵少)。提出「多幀」概念,讓模型利用連續前後幀學習飛行軌跡特徵;後續演進為「多進多出」(10-in-10-out)設計以提升吞吐量。
  • 為什麼以「每一拍」為單位 — 羽球是隔網運動,選手唯一能控制球的時刻就是擊球瞬間。因此資料以每次擊球為單位:擊球姿態(正手/反手、慣用手腳,因羽球是「同手同腳」運動)、擊球點高低(高於網表示保有主動性,低於網則相對弱勢)、擊球位置座標。
  • 案例分析 — 失分類型分布(掛網/出界/落地失分/判斷失誤)並用實際錄影佐證;殺球數與有效殺球率比較呈現不同打法風格;跑位熱區分析,以戴資穎為例:對手因忌憚其前場技術刻意將球處理至後場,因此她的後場回球機會與移動速度數據均高於對手,驗證戰術意圖在數據上的具體呈現。
  • 逐拍勝率貢獻模型 — 利用歷史比賽的站位、擊球資料,回推每一拍擊球後贏得該回合的機率,再以相鄰拍之間的機率差量化「這一拍讓誰獲益多少」,協助教練精準指出決定勝負的關鍵幾拍。
  • 智慧羽球場館系統 — 模組化、易擴充的分散式多攝影機系統,各攝影機端先做邊緣運算影像前處理,再彙整多機資料做 3D 軌跡解析,以 Docker 部署。單台搭載 RTX 4090 的 AI PC 可即時處理 8 支攝影機(實測上限約 12 支)。定位為開放 IoT 介面,期望資料可供第三方應用開發。
Video can tell story —— 轉播影片實際上裡面記錄了比賽裡面所有的詳細的資料。

07 · 李志清 —— 臺灣希望創新

AI賦能無人機:從巡檢到軍事的跨界應用

從無人機群飛展演起家,展示公司如何把 AI 逐步導入巡檢(橋梁裂縫偵測、半導體廠自主巡檢)與軍事(無人船、彈簧刀式攻擊無人機)應用,並揭露正與和碩、聯發科合作以天璣 9400 打造國產無人機 AI 電腦模組。

  • 懂 AI 但不熟無人機硬體者最適合的切入點 — MAVLink protocol 是無人機與地面站溝通的核心通訊協定(含心跳、狀態回報、指令下達)。飛控軟體兩大陣營:ArduPilot(源自 2009 年 Arduino Mega,現轉 STM32/ARM,100% 開源、GPL 授權)與 PX4(由基金會支持)。
  • 感測器成本變化 — 早年慣性導航元件要價 30 萬台幣且進口需簽切結書(防作飛彈用途),現同等元件僅 3 美金,但雜訊需濾波處理。
  • 橋梁巡檢無人機 — Y6 構型(六馬達避免拍到自身機臂)+ Intel RealSense 視覺+慣性導航。橋下無 GPS 訊號,靠視覺+IMU 精準定位飛行,每移動 50 公分拍照一張,相片解析度需達 0.2mm 以偵測最小裂縫。
  • 半導體廠案例 — 於嘉義場域驗證全自主飛行穿越 1 米寬隧道、自動避障、精準降落充電,巡檢 AGV 看不到的死角。
  • 第二代飛機升級 — 改用 LiDAR+NVIDIA Orin NX、自動 dock 降落充電收納、雙光相機(可見光+熱影像);另開發四魚眼相機 360° 環景避障(校正拼接魚眼影像 → 類神經網路估測深度 → 建立點雲),已於台北辦公室走廊實測自主定位導航。
  • 國產化計畫 — 與和碩、聯發科合作,用天璣 9400(算力約 50 TOPS,滿足四目魚眼影像定位導航避障需求)取代 NVIDIA 模組,搭載 Linux+ROS2、自研 VIO 演算法。預計定價約 600 多美金、算力約 100 TOPS(與 Orin NX 相當)。無人機重量功耗「克克計較、瓦瓦計較」。
  • 軍事應用 — 國防部軍備局公開演習影片中兩款固定翼為該公司產品。提出「偵打分離」概念:偵察機負責回傳座標,巡飛彈負責打擊、打擊前仍靠視覺確認目標。俄烏戰場因通訊干擾興起光纖無人機,AI 的角色是在通訊/定位被干擾時仍能鎖定目標自主完成攻擊。
我常說,在座可能大家是 AI 的專家,那我是什麼專家?我是搞飛機的專家。
最後我的 AI 會操作我的飛機往那個目標去攻擊,這個是很殘忍的事情但是是現在正在發生。

08 · 陳奕廷 —— 陽明交大

邁向以人為本的實體人工智慧

主張在全球競逐「蒐集大量資料訓練通用機器人 foundation model」的主流路線之外,應以「以人為本」的方法論切入 physical AI,並用輔助餵食機器人與情境式自駕安全驗證兩個案例,說明真正落地需要理解使用者需求、建立情境化安全驗證機制,以及跨校培育人才三件事。

  • 歷史錨點 — Shakey the Robot(1966–1972,Stanford Research Institute)已具備 perceive-reason-act 的先驅架構,當年開發出的 A* search 至今仍用於 Google Maps 路徑規劃。
  • 輔助餵食 — 市售的 Obi 餵食機器人設計給身心障礙者用餐,但動作是預先設定(挖取固定位置),無法對環境變化反應。示範影片中朋友用其挖冰淇淋,機器人不知道食材質地不同,硬挖導致食物噴濺。
  • 團隊演算法在挖取過程中即時評估「未來潑灑機率」(以紅/藍風險曲線視覺化),據以修正挖取動作,並延伸支援插草莓、沾巧克力醬等複合動作序列。
  • 更難的是主觀感受 — 餵食不只是把食物送到嘴邊,也要顧及入口大小等進食體驗(示範影片中一口食物太大讓學生「吃得很累」)。使用者訪談發現:台灣輔具示範幾乎不存在、輔具價格昂貴,且使用輔具容易讓使用者失去進食自主性。
  • 情境式安全驗證 — 以台灣常見交通情境切入(機車闖紅燈突然竄出、汽車駕駛注意力分散),並引用 Cruise 在舊金山發生死亡事故導致公司幾近終止營運的案例。ISO 21448(SOTIF)是驗證 AI 黑盒系統能否有效理解場景、安全運作的標準。
  • 現行方法 scalability 不足 — 特定場域測試、封閉道路測試難以涵蓋台灣獨有的高密度異質混合車流。團隊的模擬流程:用無人機在事故熱點路口蒐集數十小時影像 → 標註特定危險情境(前車煞車、切車)→ 統計分析 → 轉為 OpenSCENARIO 格式模板 → 對接開源自駕系統(Autoware、Apollo)做 unified bridge 模擬驗證 → 輸出 safety performance report。
  • 資料蒐集瓶頸 — 無人機續航僅約 20 分鐘,難以做長時間 streaming 資料蒐集,團隊正評估改用 V2X 資料或道路監控系統做長期蒐集。
  • 人才 — 實驗室學生成立新創公司 Twins Robotics;陽明交大機器人中心主題為「Robot as a team member」,推動 human-robot collaboration for critical mission,結合陽明醫學院/護理與交大電機資工跨領域資源,並已建立真實照護場域。2025 年暑假辦跨校共備營隊,至少 4 校參與。
我希望這個機器人可以進到我的家中,幫我做各種不同的事情……但如果它進到我家的話 —— 我家很亂,那他要怎麼樣 figure out 說我家是長什麼樣子?
當年他們是在 Stanford Research Institute,我們不需要在一個 institute 裡面,我們能透過整個台灣力量來推進這件事情。

09 · 孫紹華 —— 台大電機

程序引導式機器人學習

主張主流用神經網路作為機器人「大腦」的黑盒 policy 存在泛化能力與可解釋性兩大缺陷(以迷宮實驗證明神經網路只是死記硬背而非學會「右手定則」),並介紹 Program-Guided Robot Learning:讓機器人在行動前先合成一段人類可讀、可驗證、可局部除錯的 program 作為決策邏輯。

  • 工業自動化 vs 通用機器人智慧 — 工業自動化場景被刻意設計成低多樣性的封閉結構化環境(避免出錯),難以孕育真正智慧。家用/通用機器人須面對三大挑戰:高度非結構化、多變的環境;未知物件(需自行估計 3D 結構、材質、重量、抓取點、摩擦係數,而非工廠場景中預先已知的物件庫);需學習全新任務,而非僅執行原廠寫死的任務。
  • 定義層次 — Generative AI(語言/視覺語言模型)→ Agentic AI(+digital tool use:搜尋引擎、solver、code 執行、外部 API)→ Physical AI(再加上 physical tool use:sensor 如相機/LiDAR/麥克風做環境感知,加上 actuator 如手臂/爪具做動作)。
  • Robot learning 問題形式化 — 本質是 perception(sensory input)到 action(各關節馬達扭力)的高維度 mapping(機械手掌自由度可達 24 個),主流用 neural network 建模、以 gradient descent 優化。
  • 缺陷一:泛化能力不足 — 深度強化學習 agent 在 8×8 迷宮訓練至能完美解任意佈局,看似學會「右手定則」(沿牆走出連通迷宮的通用策略,雖非最短路徑但保證走出);但放到更大迷宮時完全無法求解,證明模型只是靠高 capacity 死記硬背所有訓練過的佈局。
  • 缺陷二:可解釋性不足 — 黑盒模型無法解釋決策依據,使用者難以信任(如餵食機器人失敗時無法得知原因、無法 debug);語言模型犯錯時同樣難以追溯根因。
  • Pipeline 三模組 — Task Interpretation/Program Inference(給定 video demonstration 或 reward function,在行動前先用 domain-specific language 合成一段可讀 program)、Primitive Skills Acquisition(預先學好移動、夾取、組裝等基礎技能模組)、Task Execution(依 program 執行產生 high-level plan,再對接 low-level 馬達控制)。
  • Demo-to-Program — 神經網路訓練時會「偷懶」忽略資料中少數的 if-else 分支(因為忽略掉 loss 仍然很低),而要求生成能完整涵蓋所有 demonstration 邏輯的 program-based 方法,能正確抓出稀少的 else 分支。
  • LIPS — 先在 random program dataset 上學一個 continuous embedding space(相近的 program latent 對應相近行為),再依任務 reward function 在 embedding space 抽樣、decode 成 program、丟進環境執行取得 return,依 return 重新取樣迭代。迷宮任務上產出的 program policy 正是「右手定則」本身,可泛化到任意大小迷宮而效能不掉。
  • 可解釋性驗證實驗 — 找 USC 大學部學生(時薪 10 美金)debug LIPS 生成、尚未達滿分的 program,僅需修改 3 到 5 個 token 即可大幅提升表現。相較之下神經網路的 weights 幾乎無法由人工手動調整。
  • LLM-guided Search — 傳統 search/RL 雖能找到好 program 但速度慢(無任何常識假設);LLM 具備從網路資料學來的常識與程式撰寫能力(講者形容 LLM 是「整個人類文明的文字版 clone」),但難以直接被優化解特定任務。團隊結合 LLM 生成初始 program + search 後續優化。額外實驗發現 LLM 缺乏 credit assignment 能力(無法判斷 program 中哪部分做得好/不好),因此仍需搭配 search 或 RL。
你要真的 figure out 怎麼解迷宮這個任務,那這個右手定則的 program,就可以被 generalize 到不管什麼大小、什麼 size 的迷宮,它就是一個 general solution。

10 · 池明洋 —— 池安量子資安

無人機系統開放標準及開發平台

說明「買一台無人機」不等於「成功的無人機計畫」,並以美國警用無人機成熟商業模式、烏克蘭戰場掃雷案例、以及台灣今年風災期間無人機全數無法升空的教訓,介紹協會推動的無人機標準平台、韌性救災演習計畫,以及後量子密碼學資安框架。

  • 開放標準平台首個成功案例 — 烏克蘭戰場掃雷應用:無人機結合感測器拍攝地形、後台運算找出最佳路徑鋪設有限的排雷繩。人工規劃原需一整天,改用無人機後僅需約一小時。
  • 協會 2023 年成立,四大進行中計畫 — 去紅色供應鏈(盤點熱感測鏡頭、電池、自主飛行等關鍵技術並整合台灣能量,自 2025 年 3 月啟動、每半年盤點一次,已促成部分上市公司投入)、無人機標準平台、2026 年起投入機器人與機器狗發展、韌性救災參與計畫。
  • 美國警用無人機案例 — 自 2014 年發展至今,幾乎每個警察單位皆配有無人機,接獲報案時無人機常比警察更快到場(平均出勤時間 71 秒);鳳凰城警局每年執行超過 1 萬次以上飛行任務,已是成熟商業模式(drone as first responder)。
  • 台灣的現實檢查 — 今年台南、嘉義風災期間,當地無人機(含嘉義無人機園區)全數未能升空。原因是超過 300 支電線桿倒塌(電力與通訊共構),導致斷電斷訊、4G/5G 全無。
  • 國際救災經驗三大要點 — 通訊必須標準化;訓練不足(國外做法為每季投入 40 小時跨部門演訓,涵蓋山區救災、颱風開路、化學品清消三種情境);能力與裝備分級不足(需依任務分級認證:3D 災區建模數位孿生、不依賴 GPS 飛行、夜間飛行、即時影像回傳;若無法即時將資料傳回指揮中心,無人機隊在救災場景即失去作用)。
  • 2025 年無人機韌性救災演習計畫情境 — 空拍 3D 建模回傳指揮中心判斷道路可通行性;掃雷式自主搜救(結合熱感測+光學鏡頭尋找受災者,效率優於直升機且成本更低);無人機廣播系統安撫災民心理(斷訊約 3 小時災民心理即「封掉」);物資派送(處方藥、行動電源);通訊中繼(現有無人機約可做 100 公里長距通訊、軍規商規系統已達約 300 公里,傳輸量約 2–100Mbps,涵蓋緊急服務區約 5 公里);儲能供電(產氫儲能系統可提供約 5 度電應急,因電線桿倒塌後需先退水扶桿才能接電接通訊,空窗期可能長達 5 天以上);災後防疫消毒(高爾夫球場消毒人工需 8 小時、無人機一夜可噴完全場且不需停業)。
  • 後量子密碼學 — 量子電腦運算力提升將使現行加密方法失效;美國政府訂定 2030 年為因應期限。今年初 Google 發表的量子電腦可在 5 分鐘內解出過往需一年運算的難題。NIST 提供 risk management 框架協助評估資產與規劃演算法轉換;協會已針對無人機系統與主權 AI infrastructure 打造涵蓋加密傳輸、儲存、認證的安全平台。
  • 法規挑戰 — 高鐵軌道沿線屬禁航區。借鏡美國 FAA 歷經 3–4 年溝通,使警用無人機航線申請時間從原本 6 個月至 1 年縮短至最快 6 小時、最慢 6 天。
你買了一台無人機到你的家裡呢,到可以應用其實是兩件不同的事情,這是我想跟大家講的。
災區斷訊比災情還要危險。

11 · Lightning · 吳威翰 —— 肖準行銷

AI時代的內容變現2.0

行銷已從「精準投放(audience base)」轉向「內容為王(content base)」,展示用微調模型量產在地化口碑文案、Nano Banana 圖像編輯取代傳統攝影棚拍攝、以及多 AI agent 協作系統自動產出時事行銷貼文的實戰案例。

  • 典範轉移 — 以前用大量投放解決「觸及」問題,現在生成內容太容易,真正的困境變成「怎麼產出對的內容」。
  • Fine-tuning 案例 — 把客戶的口碑行銷文章訓練進模型,模型會自創網路流行語;講者上網查證從未出現過,稱此現象為「湧現」(emergence)。
  • 對照實驗 — 把全 Dcard 網友文章訓練成模型後,模型變得充滿仇恨與騷擾言論,證明「垃圾資料進、垃圾模型出」,資料策展比模型本身更重要。
  • 類圖靈測試實測 — 把 AI 生成文章丟到論壇,獲 1200 讚、1300 留言,甚至被平台小編轉發到官方精華區(一般要付費才能取得的版位),且沒有網友發現是業配/AI 生成。
  • 多 AI agent 協作系統 — Moana 依人設/品牌切角量產口碑文案、Pandora 做輿情監聽、Eve 當時事探子即時追蹤新聞、Johnny 規劃文章切角並將輿情資料轉為知識圖譜。
  • 成本崩塌 — 婚紗業客戶在會議現場即時生成「峇里島結婚」概念圖,取代過去要價 50 萬的實拍製作,AI 成本僅約 10 元;傳統設計師產出一張廣告素材市場行情約 3000 元,AI 可一次量產十幾張。

12 · Lightning · 張智為 —— 台灣人工智慧實驗室

開源模型浪潮來襲,企業如何掌握AI主控權

企業導入 AI 不該糾結「開源 vs. 閉源」「地端 vs. 雲端」的二選一,而應聚焦組織如何設計 agentic workflow,包含人為介入的判斷節點。

  • 常見迷思 — 抓開源模型下載回來自己微調,卻忽略「你不是 NVIDIA 最大客戶、不是 Google/Microsoft 有幾千個工程師」,要先認清自己真正要解決的題目。
  • MIT 與其前東家聯合研究的三個成功關鍵 — 找專精的 ISV 合作,不要自己什麼都做;不要找「全身都痛」的痛點做起,先挑一個能成功的種子案例(bottom-up),成功後帶動組織其他單位跟進;選擇可延展的平台,未來能種更多垂直應用。
  • Agentic flow 的重要性 — 企業真實流程不會只用一兩個 agent,例如採購流程(申請→主管核准→超額另需董事長核可→採購→出納→會計→出貨)涉及多個判斷節點,每個節點都需要 human-in-the-loop。這才是「AI 治理」真正的意涵,而非空泛口號。
  • 落地要素 — 後台參數可調整、分權限管理(董事長/總經理/admin/一般 user)、使用者可回饋標記答錯的機制、產業專屬 pre-trained 模型。「小而美的腦」比什麼都懂的大腦更適合企業。

13 · Lightning · 林庭箴 —— 愛酷智能

品牌行銷如何應用AI來創造消費者溝通

行銷的關鍵已從「投放技術」轉向「企業自有數據資產」,因為技術平權讓每家公司都能取得相同的 AI 工具,真正的差異化來自產業 know-how 與第一方數據。

案例數字
迪士尼 MagicBand2017 年上線至今累計賣出 2,900 萬個 —— 整合園區互動數據優化人流管理、動態人力配置與個人化套餐,早於現今 LLM 浪潮。
Netflix 推薦系統每年節省約 10 億美元;約 70% 以上內容消費來自推薦而非搜尋。
日商產險集團整合旗下 6 個網站數據做分眾推播與差異化廣告版位:業績成長 60%、續保率成長 80%,上線時程從 1–2 年縮短至 1–2 天。
  • 數據產業興起三因素 — 數位轉型帶來海量數據來源;數據處理與 AI 分析工具成熟;個人化需求推動千人千面服務。
  • 行銷典範轉移 — 早期廣告投遞是淺層接觸;近 5–7 年行銷科技聚焦「把 80% 業績做在 20% 忠實客戶身上」(顧客終身價值 LTV);近 2 年線上線下渠道全面打通(QR code 綁定會員、跨渠道 360 度顧客歷程畫像)。
  • 熊彼得破壞式創新理論 — 真正的破壞式創新來自「新組合」而非全新發明,數據 × AI 正是典型的新組合。
  • 引用《Lenny's Podcast》訪問微軟 AI platform CVP:微軟最擔心的兩件事是「企業過度依賴 AI」與「資安漏洞」。講者認為這反而是新商機切入點。

14 · Lightning · 莊翔甯 —— 承羽智慧

Unlocking LLM Inference with vLLM:A Quick Benchmark Guide

純技術實操分享:如何用 vLLM 框架測試硬體推論效能,涵蓋 Docker 部署眉角、NCCL 版本相容性地雷、關鍵測試指標判讀,以及業界標準 MLPerf 的比較用法。

  • 三大推論框架 — vLLM 適合多卡/多機多卡部署,企業多當標配;Ollama 類似 Docker CLI 操作,適合快速本機端測試,有現成 model repository 可直接 pull;LM Studio 為第三選項。
  • 部署眉角 — 用官方提供的 vLLM 專用 Docker image(含針對 GPT-OSS 額外打包的獨立 image);模型務必先下載到本機,不要用 online 方式直接載入,否則高機率失敗。啟動時需複寫 entry point,開兩個 command line:一個跑 model serving,另一個跑 benchmark(需額外安裝 pandas、datasets)。
  • 地雷提醒 — NVIDIA 的 NCCL(多卡並聯通訊庫)版本需對應顯卡等級:較低階新卡(如 RTX 6000 系列)需手動升級到較新版 NCCL(如 2.26.5),否則官方預設 image(原生支援 B200/H100 等高階卡)會跑不起來。
  • 關鍵啟動參數 — tensor_parallel_size(測試時用 4 張卡)、GPU memory 使用率盡量吃滿但避免 OOM。此方法不限特定平台,只要是可跑容器環境即可。
  • Benchmark 判讀(需加 --profile 才會顯示簡潔版報告)— Time to First Token(範例約 1644ms,算偏快)、扣除首次後的平均延遲、token-to-token 延遲。權衡關係固定:縮短 TTFT 會拉長後續 output token 間延遲,可透過 max_model_len 與 max_num_seqs 調整。
  • MLPerf — 可上官網比較不同硬體廠商的公開跑分,作為採購議價依據;測試標準統一,講者自家測試結果與官方數據吻合。

15 · Lightning · 賴穎萱 —— 興創知能

AI驅動AIoT×GeoAI智慧防災應用

結合 IoT 感測設備(雨量、水位、地震儀)、GIS 空間資訊平台與微調的 llama 3,打造從即時監測、風險模擬到快速決策建議報告的智慧防災 digital twin 系統,已實戰應用於新北市、台北市應變中心與花蓮地震救災。

  • 差異化定位 — 不只整合台灣既有 IoT 設備數據(雨量計、水位計、地震儀),還具備防災領域 knowledge,能做進一步 AI/大數據分析,並整合 UAV 空拍與衛星影像。
  • LLM 導入 — 以 llama 3 為基礎,訓練消防署、公所等防救災 SOP 文件與歷史地震應變經驗,產出快速決策建議報告書草稿,再由幕僚在平台上編修後供指揮官使用,取代人工彙整報告的時間成本。
  • 實戰案例 — 新北市智慧監測平台(指揮官可快速判斷救災切入點)、台北市 EOC 平台(決策者不需人在應變中心聽取報告)、高雄地震與淹水模擬、花蓮地震救災(現場以 UAV 影像即時做 3D 建模,協助指揮官從 bird view 判斷救災切入路徑)。
  • 延伸應用 — 金融/保險端:銀行放款評估資產風險、保險理賠評估高風險地區,皆可運用政府公開的土壤、地質、氣象等歷史資料做分析。
  • Digital twin 延伸 — 透過 AI 影像辨識去除敏感物件重建場域模型,用於工廠教育訓練、公安事件模擬、AR/VR 整合。

16 · Lightning · 葉子雋 —— 迪威智能

音訊AI的應用與挑戰:AI的能與不能

全年會最有價值的一場「失敗檢討」:工廠異音偵測(機器保養、揚聲器出廠掃頻檢測)為何最終沒有做成產品,以及為什麼 technology-product-market fit 比單純的辨識率更關鍵。

  • 技術本身是成功的 — 同一台馬達連續四個月的聲音,人耳難辨差異,但相似度分析成功預測「該台機器需要進廠維修」,後續送修證實判斷正確。揚聲器出廠掃頻檢測中,正常、漏風、機構零件未裝好三種聲音多數人分辨不出,實驗室環境下用基礎特徵(spectrum)+ 簡單模型(如 GMM)即可達到超越人耳的辨識率。傳統做法是老師傅一天 8 小時坐產線聽音判斷。
  • 規模化障礙 — 產線現場遠比實驗室複雜:多條產線同時運作造成收音互相干擾;硬體環境問題(麥克風因產線酸霧濃度過高導致電線燒斷故障);錄音裝置選型困難。人耳辨識率約 8 成,機器在受控環境下可達 9–9.5 成,但複雜產線現場即使加上降噪演算法也難以複製;且每個場景可能都需要重新訓練專屬模型。「可規模化」始終無法達成,最終團隊放棄產品化。
  • 現行主力產品「AI 會議記錄系統」的五個設計原則 — 模型表現佳、應用場景廣(線上線下會議皆可用)、可規模化(PC/App/網頁版全裝置支援,後台可快速替換不同 LLM)、聚焦真正好用(不迷信把所有 AI 功能都堆疊進產品)、成本合理(能賺錢)。
  • 結論 — AI 產品的成敗關鍵不是辨識率高低,而是「多麼貼合使用者體驗」。
AI 產品不只是 product-market fit,還要 technology-product-market fit。好模型不代表能對應到合適場景,能對應場景也不代表可規模化,可規模化也不代表使用者覺得好用。

17 · Lightning · 吳柏翰 —— APMIC

企業LLM私有化的關鍵概念

企業導入 LLM 的關鍵不是選哪個開源模型,而是「微調」—— 因為現有公開評測標準(多為選擇題)無法反映企業實際問答場景需求。

論點證據
企業需要微調UBS 2025 研究:86.6% 企業表示需要微調才能把企業知識帶入大模型。NVIDIA 研究:70% 的 AI agent 需透過 SLM 優化才可用。
垂直打敗通用自家 24B 模型在台灣法律垂直領域評測分數超越 GPT-OSS 120B 通用模型;且 120B 需 292GB VRAM,24B 僅需約 50GB。
評測標準有問題分析 Gemma 3 官方引用的 34 篇評測論文,80% 題型為選擇題,但商業實務多為問答題。篩出問答題型後,正確率普遍不到 80 分(多在 70 分左右),11 項中僅 4 項及格。
  • 微調三層次架構 — 主權 AI 模型(國家/文化知識層)→ 行業知識模型(金融、半導體等垂直產業)→ 企業知識模型(企業專屬,只有企業自己擁有,須由企業自建工具處理)。
  • Searching → Conversation 典範轉移 — 傳統搜尋不論查詢內容價值高低成本相同;新型態對話式 AI 中,簡單問題與複雜商業問題耗費的 token 成本相同但產出價值不同,因此需要「地端跑一般訊息、雲端跑複雜訊息」的混合架構。
  • 微調可創造「有價值的 token」 — 未微調模型面對缺乏 domain know-how 的問題時會不斷「思考」,浪費大量 token 與算力卻產出不精確答案。
  • 六項建議 — 開源模型無法直接滿足企業市場化需求;微調應分主權/行業/企業三層次;Agent AI 上線前應建立衡量標準,不能只憑「感覺好用」;企業應自建工作價值基準與知識訓練軟體;導入 AI 應「買工具優於自建」;並非所有模型都適合微調,模型「可塑性」有高有低。
水的深度不能用磅秤來秤。批評用選擇題評測判斷模型的商業可用性

18 · Lightning · 黃亮勳 —— Twinkle AI

The Art of GRPO Training

Twinkle AI 是台灣目前唯一專注打造繁體中文開源模型的社群。以「家教 vs. 自修講義」比喻解說 GRPO 與傳統 PPO 的差異 —— GRPO 免除獨立 value model、改用可直接手寫的 reward function,大幅降低訓練所需 GPU 資源,並用自家 F1 模型實測 MMLU 分數從 50 分提升到 64 分佐證。

  • 社群性質 — 不是公司,是台灣目前唯一專注打造繁體中文模型的開源社群,成立於 2025 年 1 月 2 日,成員來自台灣各地不同公司與機構、因興趣自發參與,目標是打造「台灣下一代最強繁體中文模型」。講者今年初曾一人蒐集約 30B token 繁體中文語料,獨力訓練出一個 llama 3.2 繁體中文模型並開源。
  • 繁體中文推理模型專案 — Twinkle AI 社群聯合 APMIC、國防中心三方,自 2 月籌備、4 月推出一系列以 llama 3.2 為基礎的模型:非推理版繁中模型、推理版繁中模型(含推理過程)、量化版模型,並開源自建的推理資料集(數學推理、日常推理、tool calling 推理),全數採 MIT 或 CC license 開源在 Hugging Face。
  • 3B 模型 Benchmark 成果 — 通用知識評測 TMMLU+(含台灣國考題庫,近萬題)分數明顯領先;法律知識子項 Breeze 2 分數較高(講者主動承認對手優勢);function calling(含 MCP 能力)評測分數超過 90 分且高於 GPT-4o;經 GRPO 訓練後,MATH-500 及博士生等級的 GPQA Diamond 分數皆明顯高於未訓練前。
  • 小模型實驗 — 以 Gemma 3 270M 為基礎訓練繁體中文版。原生版回答繁體提問時會混入簡體字、對台灣知識僅有基礎回答甚至有錯誤資訊;訓練後可正確使用繁體中文、回答更豐富的在地知識。數學題測試中原生版陷入重複輸出同一 token 的「鬼打牆」,訓練後可正確輸出數學公式。講者認為家用顯卡可訓練的小模型未來將扮演 router 角色、在特定領域表現優異。
  • GRPO 的限制 — 若原始模型在 pre-training 階段從未學過相關知識,GRPO 也「train 不起來」。
  • 社群周邊產出 — TwinkleLM Lab(約每 1–2 週一次的免費線上訓練課程,暱稱「深夜食堂」,多在晚上 10 點半後開課)、自建評測工具、自行蒐集訓練資料集、繁體中文 coder 模型支線、LLM 落地手機 App、LLM 紅隊工具。
比喻成本
PPO學生身邊多一位「家教」(value model)即時批改每一步要同時訓練兩個模型,VRAM/GPU 需求高;且 value model 本身就很難獲得 —— 「若你已經有一個上帝視角模型,也不需要再訓練了」
GRPO學生用「附詳解的自修講義」自我對答用可直接手寫的 reward function 取代 value model,省下大量 GPU。自家 F1 模型在 MMLU 上經 GRPO 訓練後從 50 分提升到 64 分,只用了格式檢查與長度檢查兩個 reward function。

19 · 黃能富 —— 陳昇瑋紀念講座

【陳昇瑋紀念講座】AI產業落地與實作型AI人才培育

以十年來走訪全台大小農場(露天/溫室、土耕/水耕)的第一手案例,展示 AI 視覺與聽覺技術如何真正落地解決缺工、氣候變遷、產業老化等現場痛點,並介紹自己打造的 no-code 實作型 AI 人才培育平台「AI Maker」。

  • 系統架構 — 場域端佈建各種 sensor(土壤、水、空氣、微氣象站、camera、無人機空拍採樣)→ 網路傳輸(短距 WiFi/藍芽不敷農場廣域需求,改用 LoRa/NB-IoT 長距傳輸數據,4G/5G 傳影像;太陽能供電因應無電偏遠農場)→ 雲端建模與決策 → 回饋農場自動化。地面 LoRa 約 20 公里、NB-IoT 約 3 公里;正與國家太空中心合作,透過低軌衛星(500–600 公里)解決中央山脈山難通訊不良問題。
  • 為什麼要邊緣 AI — 雲端推論來回延遲約 2–3 秒,對許多即時應用太慢,因此把模型下放到周邊設備(NVIDIA Jetson Nano/Orin),甚至進一步放到終端裝置(智慧眼鏡)做單邊推論、免通訊。
  • AI 眼鏡 vs AR 眼鏡 — AI 眼鏡只能拍攝辨識、以「聲音」回饋結果(無光學投影);AR 眼鏡有光學投影,可將辨識結果即時疊加顯示、做視覺互動(如把成熟的咖啡豆框出來)。價格:現場展示的 AR 眼鏡約 100 公克、未量產款約台幣 20 萬;量產商品版約台幣 3 萬多;小米 AI 眼鏡約人民幣 1999 元。他認為 AI/AR 眼鏡可能是「AI 落地的最好工具」。
  • 小黃瓜採收機器人 — 農民主動需求:缺工、小黃瓜生長極快需一日兩採、過熟即格外品。日本已有懸吊式採收機器人(約台幣 60 萬)。
  • 香蕉分級(屏東南州,全台最大蕉農合作社,供貨 7-11)— AI 視覺檢測撞傷與肉眼難辨的蜜蜂叮咬黑點,銳利度可超越人眼,尤其排除老花、疲勞等人因誤差。
  • 大河藻蝦蝦苗計數 — 傳統人工目測誤差可達 20%(相當於利潤空間),改用 AI 視覺一秒內精準計數;也可做動態追蹤(進食時間、蝦苗體長變化)。
  • 登革熱病媒蚊蟲卵監測(台南市)— 全市 37 區、逾 3000 個誘卵桶,過去需人工開桶目視計數,現以 AR 智慧眼鏡即時辨識、計算、傳輸。
  • 軟性輸液袋異物檢測 — AI 視覺可檢出細長纖維約 500 micron、塑膠片雜質約 400 micron,客戶進一步要求做到 100 micron(肉眼完全不可見)。現行作法為人工目視,需 20 人且要求視力 1.0。
  • AI 鳳梨敲擊棒(屏東高樹,80 公頃金鑽 17 號,外銷日本)— 含水量過高易在運輸中「流湯」導致整貨櫃退貨。傳統用熱熔膠棒敲擊、憑耳力判斷。他發明的敲擊棒內建 AI 晶片、可載入不同作物模型,敲擊後 1 秒內以紅黃綠燈顯示是否可外銷(農民要求「不能等 3 秒」)。後續發展出輸送帶+機械手臂的全自動化版本,已申請專利。
  • AI 蛤蜊分級機 — 高速輸送帶上蛤蜊下墜撞擊感測板,依聲音判斷死活。目前單線 1 秒 10 顆(約每分鐘 600 顆),農民傳統人工可達每分鐘 2800 顆,因此規劃擴充到 10 條線、每分鐘 6000 顆。
  • 太陽能 AI 乾燥設備 — 太陽能板不發電、改產生約 100°C 熱風,導入乾燥箱烘乾水果/蔬菜/香草/咖啡豆/茶葉,上加裝 AI 視覺監控烘乾過程。賣點為零碳排、符合 ESG,對比傳統露天曝曬(易受禽獸尿液、驟雨污染)與燒柴油/瓦斯乾燥車。此計畫由印尼籍與泰國籍學生團隊主導,2025 年拿下霍特獎(Hult Prize)台灣區總冠軍。
  • AI Maker — 專為培養學生/工程師創作視覺與聽覺模型的 no-code 平台,流程為「收集數據 → 標註 → 訓練 → 下載部署(手機/眼鏡)→ 執行 → 模型評量 → 迭代改進」,全程不需寫程式。並號召多所大學(清大、南臺、高雄大學等)組成分散式算力共享聯盟,讓沒有算力的高中職也能參與,聯盟已擴及印度、馬來西亞、菲律賓、日本的大學。
做 AI 就是要又快又準。
你(的機器分級效率)如果沒有比我好,你就不用來了。蛤蜊農民對黃能富團隊說的話

20 · 蔡明順 —— 閉幕

千萬個夢想一個台灣:AI競爭力的實踐

以一張屏東滿州鄉「拖拉機與白鷺鷥」照片象徵 AIA 八年耕耘,總結兩天議程並宣示 AIA 下一個 8 年將持續深化「公私協力、共創生態系、串連產官學研資源」。

  1. 持續公私協力、串連社群 — 「呼朋引伴」讓台灣的齒輪持續轉動。
  2. 共創生態系 — 他判斷台灣較難成為 AI「研發」大國,但憑藉強大的半導體與通訊供應鏈及高密度產業聚落,絕對有機會成為 AI「應用」大國,甚至打造成「台灣人工智慧島」。
  3. 帶入產官學研資源 — 持續整合既有資源朝落地方向推進,並「把國際帶進來、把自己的東西帶出去」。
  • 具體行動證明 — 前一日已與三所大學簽約,除認證推動外,將以「產業聚落中心」角度打造北中南特色化產業聚落,整合企業、大學、法人機構共同建構生態系。(本場未提校名;依 Day 1 上午陳伶志宣布內容,為政治大學、逢甲大學、南臺科技大學。)並表示 AI Maker 平台,AIA 會協助在全國更多場域推廣,觸角要延伸到目前尚未涵蓋的花東與離島地區。
  • Taiwan Inside 方程式 — AI + D(domain)再乘以 T(Taiwan way,亦可代表 technology/training/talent/tool),作為企業/個人推動 AI 的思考框架。
  • 10 月起的下一篇章 — 以「百工百業」為切角,優先從受大型語言模型高衝擊的產業切入,包括廣告、業務行銷、新聞媒體、管理顧問。
  • 預告 10 月 14 日 — 「新聞媒體 AI 關鍵論壇+工作坊」,邀請國際講者包括 Hugging Face 與新加坡 AI Center 專家,鎖定新聞媒體與廣告行銷工作者;活動採審核制、但不收費。
台灣大概沒有特別高的機會變成所謂的 AI 研發的大國,可是我們絕對可以變成應用大國。