生成式 AI 競賽進入下半場。當模型能力快速拉近,真正的競爭正從「誰有最大的模型」,轉向「誰能讓 AI 真正落地」。
iKala 共同創辦人暨董事長程世嘉(首圖)認為,台灣談主權 AI,不能只停留在打造自己的 Foundation Model,而應重新思考:從算力、模型、資料到應用,我們究竟掌握了多少自主能力?
各國都在爭主權 AI,台灣的關鍵在哪裡?
程世嘉將主權 AI 拆成四個環節:算力、模型、資料、應用。算力決定 AI 能否運轉,模型決定能力邊界,資料決定 AI 如何理解我們,而應用則決定技術最終能否創造價值。
2023 年台灣產官學界紛紛投入 Foundation Model,程世嘉帶領 iKala 從另一個問題出發:如果每個人都在造模型,誰來定義模型究竟好不好?
這個問題在 AI 走向垂直化後更加重要。Gartner 預測,到 2030 年,高達 90% 的生成式 AI 解決方案,都將採用領域特定模型(Domain-Specific Models, DxM)。企業未來面對的,不再是少數大型模型,而是大量針對不同產業、任務與場景打造的 AI。
對程世嘉而言,這正是主權 AI 的關鍵:台灣不只要使用全球最先進的模型,更要有能力用自己的資料與標準,判斷模型懂不懂我們的語言?理解我們的產業嗎?能不能完成我們要它做的事?
從「造模型」到「造尺」,把 AI 的定義權留在台灣
這也是 TMMLU+ 出現的背景。
當市場競逐繁體中文模型,iKala 選擇「不做選手,先做量尺」。TMMLU+ v1 收錄 22,690 道題目、橫跨 66 個科目,規模是前代 TMMLU 的 6 倍,研究成果正式發表於 COLM 2024,後續也被 Google、Meta 等國際研究團隊納入繁體中文模型評測。
「我們把它開源,其實就是希望無私地開放給大家使用。」程世嘉說。
他認為,一個健全的 AI 生態系需要共同遵循的規則。TMMLU+ 因此不只服務 iKala,更希望讓產業與學界共同使用、驗證與改善,讓一套從台灣出發的評測標準成為生態系共享的基礎。
這也讓「原生資料」成為關鍵。TMMLU+ 並非單純搬運或重新包裝網路內容,而是投入時間理解在地情境、萃取內容、校正框架,並持續檢查資料品質。因為模型「會說中文」,不代表真正理解台灣的法律制度、文化脈絡與生活經驗。
尤其當 AI 逐漸成為搜尋、決策與資訊取得的新入口,繁體中文在全球 AI 生態中的相對弱勢,也不再只是語言問題,更關乎台灣的資料自主。唯有持續累積可信的在地原生資料,台灣才有能力建立自己的評測標準,定義什麼是適合台灣的 AI。
從「會回答」到「會做事」,企業要的是能落地的 AI
當 AI 從聊天走向 Agent,評測的問題也從「答得對不對」,變成「事情做不做得成」。
企業真正頭痛的不是沒有模型可用,而是投入時間與花費數百萬預算完成 PoC 後,才發現模型不理解繁中語境、不符合在地規範,或實際工作流程的表現與公開 Benchmark 高分存在落差。因此,iKala 也將評測從 LLM Evaluation 延伸至 Agent Evaluation。
下一階段 iKala 不只測 AI「會不會回答」,更要測它「會不會做事」——能否理解意圖、正確使用工具、處理文字、圖片、聲音等多模態資訊,並完成企業交付的任務。
這也讓評測從技術跑分走向企業決策。當市場從「一個通用模型」走向「多個垂直模型」,企業真正需要的,不見得是全球跑分最高的 AI,而是在自己的資料、場景與成本條件下,最適合自己的 AI。
程世嘉將 TMMLU+ 開源,希望讓產業與研究社群共享這把「尺」,在建立健全 AI 生態系的同時,也讓台灣的語言與文化得以在 AI 時代持續被理解與保存。
程世嘉更表示:「我們希望 TMMLU+ 成為台灣定義 AI 能力、建立產業信任的共同基礎。」TMMLU+ 也已推出 v1.1(Huggingface / Github),重新審視既有 66 個領域,更新具有時效性的法律、社會與政令題目,持續維持評測有效性。
當世界的模型不斷改變,台灣真正需要留在手上的,是自己的資料與標準,以及選擇、衡量與定義 AI 的能力。
採訪編輯
Harper Chen
2011年起《數位時代》開始以 Meet 社群品牌推動創業家們的交流連結。從新創團隊的採訪報導、創業小聚月會的活動、產業沙龍的分享, 提供創新與創業社群相互認識與媒合的平台。 採訪推薦請來信:harper.chen@bnext.com.tw