開源 AI 模型比較 2026:Qwen 3.8、DeepSeek V4、GLM 5.3、Kimi K3、Nemotron 選型指南
截至 2026 年 8 月,Qwen3.8-27B、DeepSeek V4-Flash-0731、Nemotron 3.5 Lightning、Muse Glimmer 與 Gemma 4 是企業地端新候選;GLM 5.3 先在 Coding Plan 上線,Kimi K3 與超大型旗艦仍需叢集。本文比較授權、硬體、Agent 成本、中美路線與台灣資料主權。

2026 年 8 月 15 日更新:兩年前談開源大型語言模型,主角還是 Llama 3、Qwen 2.5 與 DeepSeek R1;現在企業真正面對的,是剛公開權重的 Qwen 3.8、DeepSeek V4-Flash-0731、GLM 5.3、Kimi K3、NVIDIA Nemotron 3.5 Lightning、Meta Muse Glimmer 30B,以及 Gemma 4、TAIDE 等更適合地端落地的模型。新版不再用過期排行榜決定答案,而是從模型是否真的能下載、授權能否商用、硬體是否負擔得起、繁體中文與工具呼叫是否穩定、資料能否留在企業內部五個面向重新整理。
先講結論:截至 2026 年 8 月 15 日,Qwen 已公開 Qwen3.8-27B 與 2.4T-A95B 權重;DeepSeek 的高成本效益主力是 V4-Flash-0731,後續另有 V4-Pro-0813;智譜最新服務版本則是 GLM 5.3。若要在企業內部實際部署,優先測 Qwen3.8-27B、Nemotron 3.5 Lightning 30B-A3B、Muse Glimmer 30B、Gemma 4 E4B/26B、gpt-oss-20b、Ministral 3 14B 與 Gemma-3-TAIDE-12B;2.4T Qwen、Kimi K3、Nemotron 3 Ultra 等旗艦雖可下載,仍屬大型叢集工程。
先釐清:「開源模型」其實有三種完全不同的東西
市場經常把「可以呼叫 API」、「可以下載權重」和「完整開源」混在一起,但三者對企業的採購、法遵與部署意義完全不同:
- 商用 API 模型:透過供應商端點使用。優點是上線快、不必維運 GPU;缺點是資料會離開自有環境,價格、版本與停用時程由供應商控制。即使同系列已有權重可下載,API 服務也可能另加多模態、工具與更長上下文,例如 Qwen3.8-Max。
- 開放權重(open-weight)模型:可以下載參數、在自己的機房或私有雲推論,通常也能微調;但訓練資料、完整訓練程式與製作流程未必全部公開。Qwen 3.8、DeepSeek V4、Kimi K3、Nemotron、Muse Glimmer、Gemma 4 與 TAIDE 都屬於這個實務上最常見的類別。GLM 5.3 截至更新日則先在 Coding Plan 開放,API 尚待上線。
- 符合完整開源定義的 AI:除了權重,還要提供足以研究、修改與重建系統的資料資訊與訓練程式。Open Source Initiative 的 Open Source AI Definition 1.0 對此有更嚴格的要求。
因此本文沿用市場常說的「開源 LLM」,但在規格與建議中會精確標示是API、開放權重或完整可地端部署。這不是文字潔癖:如果採購需求是資料不得離開內網,API 模型即使能力再強也不是候選;如果需求是可修改與轉授權,光能下載權重也不夠。
2026 主流模型總表:從 Qwen、DeepSeek 到 Nemotron、Muse Glimmer
| 模型 | 取得方式 | 公開規格 | 上下文 | 企業選型重點 |
|---|---|---|---|---|
| Qwen3.8-27B | API(即將提供)+開放權重 | 27B dense,原生視覺語言 | 262K 原生,可延伸至 1M | Apache 2.0;支援影像、影片、思考開關與 reasoning effort,是本代最適合企業先做地端 PoC 的 Qwen。 |
| Qwen3.8-2.4T-A95B/Max | API+開放權重 | 2.4T/95B active | 262K 原生,可延伸至約 1.01M | 首次公開 Qwen Max 級權重;採 qwen3.8-max 專屬授權,API 版另有視覺、工具與預設 1M 等功能。 |
| DeepSeek V4-Flash-0731 | API+開放權重 | 284B/13B active,另含 DSpark 推測解碼模組 | 1M;最大輸出 384K | MIT;以重新後訓練大幅提升 Agent 能力,官方 API 每百萬 tokens 未命中輸入/輸出為 US$0.14/0.28,主打任務完成成本。 |
| DeepSeek V4-Pro-0813 | API+開放權重 | 約 1.7T 總參數/49B active | 1M;最大輸出 384K | MIT;偏高難度推理與長程 Agent,8 月 12 日起接替 Pro Preview 成為 deepseek-v4-pro 端點的版本。權重同樣可下載,但完整部署的叢集需求遠高於 Flash。 |
| GLM 5.3 | Coding Plan;API 即將提供 | 沿用 GLM 5.2 基礎模型,以後訓練升級 | 1M;最大輸出 128K | 純文字、強制思考,支援 low/high/max;重點是複雜工程、終端 Agent 與資安任務,目前不能把它寫成已公開新權重。 |
| Kimi K3 | API+開放權重 | 2.8T/104B active | 1,048,576 tokens | 原生多模態、長文件與長時程知識工作能力突出;採 Kimi K3 自訂授權,商用前要逐條審閱。 |
| Nemotron 3.5 Lightning | API/NIM+開放權重 | 30B/3B active | 1M | OpenMDW-1.1,提供 NVFP4/BF16;瞄準高吞吐、低延遲 Agent 執行,適合 NVIDIA GPU 與企業部署生態。 |
| Nemotron 3 Ultra | API/NIM+開放權重、資料與 recipes | 550B/55B active | 1M | OpenMDW-1.1;負責長程 Agent 的高難度推理與協調,仍是資料中心級模型。 |
| Meta Muse Glimmer 30B | 開放權重 | 約 29.6B dense+視覺編碼器 | 131K+ | Apache 2.0;官方 4-bit 版本可在 24/32GB 裝置執行,強項是本機多模態 Agent、工具使用與失敗恢復。 |
| Gemma 4 | API+開放權重 | E2B、E4B、26B MoE(約 3.8B active)、31B Dense | 128K(edge)/最高 256K(大型) | Apache 2.0;全系列支援影像與影片,E2B/E4B 另支援音訊,涵蓋端側、筆電與工作站。 |
註:參數、上下文與授權依各模型官方發布頁整理。上下文上限不代表在該長度下仍有同等準確率、速度或成本;預覽版規格也可能變動。採購前應重新查看官方 model card 與 license。
企業選型能力矩陣
這張圖不是把不同廠商、不同測試條件的 benchmark 硬湊成排行榜,而是依官方規格、可用模態、模型尺寸與本文企業情境整理的 1 至 5 級首輪選型指標。
| 模型 | Agent/Coding | 多模態 | 正體中文潛力 | 地端易用度 | 建議角色 |
|---|---|---|---|---|---|
| Qwen3.8-27B | ★★★★★ | ★★★★★ | ★★★★★ | ★★★★★ | 中文多模態地端基線 |
| DeepSeek V4-Flash-0731 | ★★★★★ | ★★★★★ | ★★★★★ | ★★★★★ | 高成本效益 Agent 品質上限 |
| GLM 5.3 | ★★★★★ | ★★★★★ | ★★★★★ | 服務限定 | 工程與終端 Agent 對照組 |
| Kimi K3 | ★★★★★ | ★★★★★ | ★★★★★ | ★★★★★ | 超長文件與多模態旗艦 |
| Nemotron 3.5 Lightning | ★★★★★ | ★★★★★ | ★★★★★ | ★★★★★ | 高吞吐 Agent 執行層 |
| Muse Glimmer 30B | ★★★★★ | ★★★★★ | ★★★★★ | ★★★★★ | 24/32GB 本機多模態 Agent |
| Gemma 4 E4B | ★★★★★ | ★★★★★ | ★★★★★ | ★★★★★ | 端側多模態與西方供應鏈 |
| Gemma-3-TAIDE-12B | ★★★★★ | ★★★★★ | ★★★★★ | ★★★★★ | 台灣語境驗收基線 |
讀法:★★★★★ 代表相對適合本文設定的企業任務,不代表跨模型的絕對能力。正體中文仍須以企業自有台灣題庫重測;「地端易用度」同時考量權重是否公開、模型總尺寸與官方部署支援。
主流模型路線,真正的差異在哪裡?
Qwen 3.8:27B 可地端,2.4T 旗艦要先看授權與叢集成本
Qwen 3.8 發布節奏很快,選型時必須拆成三個產品看。Qwen3.8-27B 是 27B dense 的原生視覺語言模型,採 Apache 2.0,能理解文字、影像與影片;原生上下文 262,144 tokens,可延伸到 1M,並支援思考開關與 reasoning_effort。官方列出 Transformers、vLLM、SGLang、TokenSpeed 等執行方式,也提供量化版本入口,因此它已是可下載、可在企業內部部署的務實候選。
Qwen3.8-2.4T-A95B 則是 2.4T 總參數、每 token 啟用 95B 的 MoE 旗艦,原生 262K、可延伸至約 1.01M。它雖然也公開權重,卻採 qwen3.8-max 專屬授權,不能直接套用 27B 的 Apache 2.0 結論;完整部署也屬資料中心級。Qwen3.8-Max API 以此為基礎,另提供視覺輸入、非思考模式、預設 1M 上下文與內建工具等代管功能。
DeepSeek V4-Flash-0731:重點是 Agent 任務經濟,而不只是低 token 單價
DeepSeek-V4-Flash-0731 是本文介紹 DeepSeek 的主版本。它沿用 V4-Flash Preview 的 284B/13B active 架構,以重新後訓練提升 Agent、程式與工具使用能力,並附帶 DSpark 推測解碼模組。官方 model card 顯示它在多項 Agent benchmark 超越先前的 V4-Pro Preview;支援 low、high、max 三段推理強度,權重採 MIT 授權。
它真正改變的是「Agent economics」:企業不應只比較每百萬 token 價格,而要比較完成一項工作需要多少輪、多少 token、多少次失敗重試。官方 API 在更新日的每百萬 tokens cache-miss 輸入/輸出價格為 US$0.14/0.28,1M 上下文、最大輸出 384K,且高/最大推理強度可支撐長任務。要注意 DeepSeek 已公告自 2026 年 8 月 16 日起改為尖峰與離峰兩段計價,離峰為尖峰的一半,估算成本時應把貴公司的實際使用時段納入。低單價加上較好的任務完成率,才構成 Flash 的成本優勢;產業分析所稱的 Agent economics,本質就是把 token 單價改算成任務完成成本。若工具錯誤率高、反覆重跑,再便宜的 token 也不會便宜。
GLM 5.3:同一底模靠後訓練升級,但目前先是服務版本
智譜於 8 月 14 日更新官方文件,GLM 5.3 已在 GLM Coding Plan 全量提供,模型 API 則標示「即將上線」。它沿用 GLM 5.2 的 743B MoE 基礎模型,能力提升全部來自後訓練,重點是複雜軟體工程、終端操作、長程 Agent 與漏洞分析,而不是再擴大基礎參數。與 GLM 5.2 幾乎同步在 Hugging Face 釋出 MIT 權重不同,官方這次表示要先完成安全評估,再分階段開放權重與更廣的 API,因此在權重實際上架前,不應把它排進地端容量規劃。
GLM 5.3 為純文字模型,支援 1M 上下文與最大 128K 輸出;思考模式永遠開啟,僅能在 low、high、max 三種強度間調整。
Kimi K3:原生多模態與 1M 脈絡,但部署是資料中心級工程
Kimi K3 是 2.8T 總參數、104B active 的原生多模態 MoE 模型,可在同一模型內處理文字、影像與影片並支援 1M 上下文,定位在長時程 Coding、深度研究與知識工作。官方提供 vLLM、SGLang 與 TokenSpeed 的部署方向,也提供 OpenAI/Anthropic 相容 API。
它的價值在於把長文件、多模態理解與 Agent 執行放進同一模型,但代價是龐大的權重與推理基礎設施。另一個差異是授權:Kimi K3 並非 Apache 2.0 或 MIT,而是自訂的 Kimi K3 License。若要重新散布、提供 SaaS、微調後商用或處理跨境資料,法務必須直接審閱當期條款,不能只看「open-weight」標籤。
NVIDIA Nemotron:3.5 Lightning 負責高吞吐,Ultra 負責高難度協調
Nemotron 3.5 Lightning 30B-A3B 是 NVIDIA 最新的效率型路線:30B 總參數、每 token 啟用 3B,提供 NVFP4 與 BF16 權重,適合高頻工具呼叫、Agent 子任務與低延遲企業服務。它不以單次最深推理取勝,而是把每張 NVIDIA GPU 的吞吐、延遲與正式部署工具鏈做成一體。
Nemotron 3 Ultra 則是 550B/55B active、1M 上下文的長程 Agent 協調模型,權重、資料與訓練 recipes 一併公開,採 Linux Foundation OpenMDW-1.1。再往下還有 120B/12B active 的 Nemotron 3 Super,以及 Content Safety、RAG、Speech 等專用模型。NVIDIA 的企業主張不是「一個模型包辦全部」,而是讓 Lightning/Super/Ultra 與檢索、安全、語音模型分工,再透過 NIM、TensorRT-LLM、Dynamo 與 NeMo 工具部署。
Meta Muse Glimmer 30B:真正瞄準消費級硬體的本機 Agent
Muse Glimmer 30B 由 Meta Superintelligence Labs 發布,約 29.6B dense,另含約 1.8B 的視覺編碼器,支援文字與影像輸入、131K+ 上下文、工具使用、長程規劃、失敗恢復與可調 reasoning strength。它採 Apache 2.0,而不是過去常見的 Meta 自訂 Llama 授權。
它最值得企業注意的不是排行榜,而是官方直接提供完整精度、兩種 4-bit 權重與 DFlash drafter:量化後可把語言模型壓到 20GB 以下,目標是在 24GB/32GB 記憶體內同時容納模型、KV cache、視覺編碼器與推測解碼。這使 Muse Glimmer 成為少數明確針對離線多模態 Agent、消費級 GPU 與 Apple Silicon 類裝置設計的新模型。
不是每家公司都需要旗艦模型:七個更容易落地的候選
旗艦模型適合拿來定義品質上限,真正進入企業機房的模型往往小一到兩個量級。以下候選更值得放進第一輪 PoC:
- Qwen3.8-27B:中文、視覺、程式與 Agent 能力均衡,Apache 2.0;適合一般企業內部知識助理與多模態文件流程,但台灣公部門與特定採購案需先檢查來源國政策。
- Nemotron 3.5 Lightning 30B-A3B:高吞吐、1M 長上下文與 NVIDIA 推理生態是主要優勢,適合作為大量 Agent 子任務、工具呼叫與地端共享服務的執行模型。
- Muse Glimmer 30B:Apache 2.0、文字加影像,官方量化版鎖定 24/32GB 裝置;適合本機多模態 Agent、GUI/文件理解與離線工具流程。
- Gemma 4 E2B/E4B/26B MoE/31B:E2B 與 E4B 鎖定端側多模態並支援音訊;26B 每次推論約啟用 3.8B,31B 則偏最高品質,適合希望兼顧部署便利與西方供應鏈的團隊。
- gpt-oss-20b/120b:Apache 2.0 的文字推理模型。官方資料顯示 20b 量化權重可在約 16GB 記憶體環境執行,120b 則以單張 80GB GPU 為目標;工具呼叫與結構化輸出是主要優勢。
- Ministral 3 3B/8B/14B:Apache 2.0,提供 base、instruct 與 reasoning 版本,適合邊緣裝置、低延遲服務與多語場景;若需要最大品質,再評估 Mistral Large 3。
- Gemma-3-TAIDE-12B-Chat-2602:TAIDE 團隊以 Gemma 3 12B 為基礎,加入台灣文本並強化辦公任務與正體中文對話。它不一定在全球英文排行榜領先,但在台灣行政、文化與用語情境值得單獨測試。
如果你的主要工作是 RAG 問答、摘要、分類、欄位擷取或客服草稿,中型模型搭配乾淨知識庫,常比裸用超大旗艦更有成本效益。可延伸閱讀本站的地端 AI 部署指南與台灣企業 LLM 選型指南。
Gemma 4:從手機到工作站的完整模型帶
Gemma 4 採 Apache 2.0,家族共有 E2B、E4B、26B MoE 與 31B Dense 四種尺寸。E2B/E4B 以 128K 上下文和端側效率為主;大型版本最高 256K。全系列可處理文字、影像與影片,E2B/E4B 另支援音訊。
一般企業可先用 E4B 驗證手機、IoT 與離線多模態流程,再用量化 26B/31B 測工作站級推理。26B 每次約啟用 3.8B 參數,偏重低延遲與吞吐;31B Dense 偏重品質與微調彈性。Google 表示大型版本的未量化 BF16 權重可放入單張 80GB H100,量化版本則能在消費級 GPU 執行,但仍應用真實上下文與同時請求量壓測。若台灣企業因供應鏈或政府採購限制不便採用中國來源模型,Gemma 4 是模型尺寸、授權與部署工具都相對完整的替代線。
TAIDE 為什麼仍要保留?全球榜單不會替你測台灣語境
Gemma-3-TAIDE-12B-Chat-2602 並不是 Gemma 4,而是以 Gemma 3 12B 為底模,加入台灣文本並強化辦公任務、正體中文對話與在地用語。它的價值不是和 2.4T 旗艦比世界知識,而是作為台灣行政、公文、教育、客服與企業知識流程的在地基線。
實測時至少加入台灣法規名稱、政府機關名稱、民國/西元日期、統一編號、地址、幣別、全形標點,以及「軟體/程式、資料/數據、帳號/賬號」等兩岸詞彙差異。最合理的做法不是預設 TAIDE 一定贏,而是讓 TAIDE、Gemma 4 E4B/26B、Qwen3.8-27B、Muse Glimmer 與 Nemotron Lightning 在同一套台灣題庫競爭。
硬體怎麼估?不要只看 active parameters
模型權重的理論下限可粗估為「總參數量 × 每參數位元數 ÷ 8」,但這只算權重,不含 KV cache、視覺編碼器、推理框架、運算暫存、批次與同時請求。實際採購至少要用目標上下文與同時使用者數做壓力測試。
| 環境級距 | 較合理的模型範圍 | 適合用途 | 注意事項 |
|---|---|---|---|
| 16 至 32GB 統一記憶體/顯示記憶體 | 3B 至 12B 量化模型,部分 20B MoE | 個人測試、單人文件問答、離線摘要 | 長上下文會快速吃掉 KV cache;不要以「能載入」等同「可服務多人」。 |
| 32 至 64GB | 12B 至 35B 量化模型 | 部門 PoC、低同時請求量的 RAG、程式助理 | Qwen3.8-27B、Muse Glimmer 30B 與 Nemotron 3.5 Lightning 可列入實測,但視覺與長上下文會提高需求。 |
| 80GB 單卡或多卡伺服器 | 高品質 70B 至 120B 級量化/MoE | 企業內部共享服務、中等同時請求量 | 要量測 tensor parallel、prefill、decode 與故障切換,不只看單次 tokens/s。 |
| 多節點 GPU 叢集 | Qwen3.8-2.4T、DeepSeek V4、Kimi K3、Nemotron 3 Ultra 等旗艦 | 追求前沿品質、研究或大規模服務 | 網路互連、模型切分、推理引擎與維運人力通常比單一 GPU 型號更關鍵;GLM 5.3 尚未公開新權重,不應先列入自建容量。 |
採購原則:先在租用環境以真實流量跑完 PoC,再依尖峰同時請求量、P95 延遲、平均輸出長度與可接受的量化損失反推硬體。不要根據網路上一張「幾 GB 可以跑」的表直接下單。
LM Studio、Ollama、vLLM、SGLang 怎麼分工?
- LM Studio:適合桌面 GUI 體驗、模型搜尋與快速比較。非工程人員也能測 GGUF/MLX 等量化版本,但正式商用前仍要確認模型來源、授權與應用程式的企業條款。
- Ollama:適合開發者在 macOS、Windows 或 Linux 快速啟動本地模型與 API,建立 RAG 或 Agent 原型。模型標籤可能指向不同量化版本,上線前要固定 digest,避免更新後結果漂移。
- vLLM:適合 NVIDIA/AMD 伺服器上的高吞吐服務,提供 OpenAI 相容 API、continuous batching、tensor parallel 等能力;目前多個新模型的官方 model card 都直接提供 vLLM 部署方式。
- SGLang:適合複雜 Agent、長上下文與高效結構化生成;對超大型 MoE 模型的支援通常與 vLLM 並列為官方建議方案。
簡單說,LM Studio/Ollama 解決的是「讓模型先跑起來」,vLLM/SGLang 解決的是「讓模型在多人、長上下文與可監控的條件下穩定服務」。正式環境還需要身分驗證、權限、限流、審計、內容安全、版本鎖定與備援,推理引擎本身不會自動補齊這些治理能力。
企業選型不要再只看排行榜:建立自己的驗收集
MMLU、AIME、SWE-bench 與 Chatbot Arena 能反映部分能力,卻不能代表你的發票、法規、公文、客服對話或內部程式庫。更可靠的做法,是建立 100 至 300 題的代表性驗收集,並固定提示詞、工具、推理框架與評分規則。
- 任務品質:答案正確率、引用命中率、欄位擷取 F1、程式測試通過率。
- 繁體中文:台灣用語、法規名稱、人名地名、全形標點、日期與幣別格式;不要用簡體中文 benchmark 代替。
- Agent 穩定度:工具選擇、JSON schema 遵循、參數完整度、錯誤後能否恢復、長任務是否偏離目標。
- 效能:time to first token、輸出速度、P50/P95 延遲、尖峰同時請求量、長上下文 OOM。
- 安全:提示注入、越權工具呼叫、敏感資料外洩、錯誤引用與拒答行為。
- 總成本:API token 費、GPU 折舊、電力、機房、監控、升級與維運人力,不只比較每百萬 token 單價。
每題至少重跑三次,因為生成式模型不是完全決定性的;同時保存模型 ID、權重雜湊、量化格式、推理引擎版本與 sampling parameters,否則下個月無法解釋分數為何改變。
中美開放模型路線差異:一邊用密集迭代搶生態,一邊把開放做成產業底座
把 2026 年的模型只分成「中國開源、美國閉源」已經不準確。較接近現況的觀察是:中國模型商正以超大型 MoE、1M 長上下文、密集的日期版號與極低 API 單價快速爭取開發者。Qwen3.8、DeepSeek V4、GLM 5.3、Kimi K3 都強調程式、工具呼叫與長程 Agent,且常在幾週內用後訓練更新迭代。不過「中國模型」也不是同一授權:Qwen3.8-27B 是 Apache 2.0,2.4T 旗艦、Kimi K3 則各有自訂條款;GLM 5.3 目前更是先上服務、未同步成為一套新公開權重。
美國路線則呈現雙軌:最前沿的商用模型仍以封閉 API 為主,另一條開放權重線則集中在可落地尺寸、寬鬆授權、端側/資料中心硬體整合,以及完整的資料、工具與安全生態。Google Gemma 4 從端側到 31B,Meta Muse Glimmer 鎖定 24/32GB 本機多模態 Agent;NVIDIA Nemotron 更把 Lightning、Super、Ultra、資料集、訓練 recipes、NIM 與 TensorRT-LLM 串成一套企業部署堆疊。OpenAI 的 gpt-oss、Mistral 與 AI2 等路線,也讓美國與盟國供應鏈不再只有 Llama 一個選項。
這個差異並非能力高下,而是生態策略不同:中國廠商多以模型速度、規模與價格擴大採用,美國開放陣營則更強調運算平台、開發工具、垂直模型與制度化的開放生態。對台灣企業而言,真正的分界不是國籍標籤,而是來源國政策、授權、資料流向、能否固定版本、硬體綁定與供應鏈風險;同一家公司不同任務,完全可能選不同路線。
黃仁勳在 X 的首篇貼文:開放模型能強化安全、創新與自主性
2026 年 7 月 24 日,NVIDIA 執行長黃仁勳(Jensen Huang)在 X 發出個人帳號的首篇貼文。他分享 NVIDIA 共同簽署的公開信,並直接說明為何開放模型重要。他的核心論述是,AI 將改變每個產業、支援每家公司,也會由每個國家建構;開放模型則能強化安全與資安、加快創新與技術普及,並提升各國及企業的 AI 自主性。
這篇貼文連結的是 7 月 24 日發布的 Open Weights and American AI Leadership 聯合公開信。NVIDIA 與 Meta、Google、OpenAI、Microsoft、Hugging Face、Linux Foundation 等組織共同主張,開放權重能降低創業與研究門檻、增加競爭、減少單一供應商綁定,也讓客戶保留資料與部署控制權。公開信同時提醒政策制定者,不宜用過早又過度廣泛的限制壓縮開放模型的發展空間。
因此,本文談的不是黃仁勳個人單獨撰寫一份「宣言」,而是他選擇在 X 的首篇貼文公開支持這套聯合論述。對企業最實際的意義,是把開放權重視為可治理的基礎設施選項,讓模型能在自有環境中接受檢查、最佳化與組合,也保留未來更換模型或硬體的彈性。
台灣企業還要多看一層:資料主權與供應鏈政策
地端部署能讓推論資料留在企業內部,但不會自動解決所有資安問題。下載權重時仍要確認來源與雜湊;使用 trust_remote_code、第三方量化包或自動更新時,仍可能執行外部程式;推理服務也需要停用不必要的遙測、限制對外連線並建立軟體物料清單。
對台灣公部門而言,來源國也不是可忽略的條件。數位發展部已明確說明,公務機關禁用 DeepSeek AI 服務,包含雲端、App 與地端下載;政府採購契約也可能限制中國大陸廠牌資通訊產品。這不等於一般民間企業一律不得使用中國模型,但政府機關、關鍵基礎設施與承作政府標案的廠商,應在 PoC 前先取得資安與採購單位書面確認。若來源限制較嚴格,可優先評估 Gemma、gpt-oss、Mistral、TAIDE 等候選。
2026 年企業導入的務實流程
- 先定義紅線:資料能否離開台灣、能否使用中國來源模型、是否需要商用轉授權、是否允許第三方代管。
- 用 API 建立品質上限:挑一到兩個旗艦模型測真實任務,確認「最好的模型」到底能把問題解到什麼程度。
- 用中型開放權重模型做地端基線:在同一題庫比較 Qwen3.8-27B、Nemotron 3.5 Lightning、Muse Glimmer、Gemma 4、gpt-oss、Ministral 3 與 TAIDE。
- 先做 RAG,再決定微調:知識更新頻繁、答案需要引用來源時,先改善文件切分、檢索與權限;只有格式、語氣或固定行為無法靠提示與 RAG 解決時,才投入 fine-tuning。
- 壓測後再買硬體:用真實上下文、輸出長度與同時請求量測,不用單人聊天速度推估正式容量。
- 建立模型閘道:讓應用透過一致 API 存取多個模型,保留版本切換、回退、成本路由、日誌與安全政策,避免業務系統綁死單一供應商。
多數企業最後採用的會是混合架構:敏感文件與高頻固定任務走地端模型,公開資訊與少量高難度推理走雲端旗艦;應用層透過 RAG、模型閘道與審計紀錄統一管理。LargitData 的 RAGi 企業知識平台與 QubicX 地端 AI,正是把知識檢索、模型部署與企業治理放在同一套架構中處理。
2026 企業選型常見問題
第一輪 PoC 應該先測哪些模型?
先用一個雲端旗艦建立品質上限,再選三個可落地候選:Qwen3.8-27B 作中文多模態基線、Gemma 4 E4B/26B 或 Muse Glimmer 作西方供應鏈與本機多模態基線、TAIDE 作台灣語境基線。大量 Agent 子任務再加入 Nemotron 3.5 Lightning;不要第一輪就部署 2.4T Qwen、Kimi K3 或 DeepSeek V4 全量權重。
24GB/32GB 裝置實際能跑哪些新模型?
Gemma 4 E2B/E4B 是最明確的端側選項,Muse Glimmer 30B 也有鎖定 24/32GB 裝置的官方 4-bit 版本;TAIDE 12B 適合作為正體中文測試。Gemma 4 26B/31B 與 Qwen3.8-27B 則需依量化、上下文與裝置架構實測。能載入不等於能支援多人服務,長上下文與 KV cache 仍會快速增加記憶體需求。
哪些「最新模型」真的有權重可以下載?
Qwen3.8-27B/2.4T-A95B、DeepSeek V4、Kimi K3、Nemotron、Muse Glimmer 與 Gemma 4 都有公開權重,但授權與部署門檻不同。
DeepSeek V4-Flash-0731 和 Pro-0813 怎麼選?
兩者都採 MIT 授權並公開權重,差別在成本效益與部署門檻。Flash-0731 是 284B/13B active,適合大量 Coding、工具呼叫與 Agent 任務;Pro-0813 是兆級 MoE,偏向更高難度推理與長程工作,地端完整部署的叢集成本高出許多。先以每項任務的完成率、重試次數與總 token 成本比較,不要只用單次 benchmark 或每百萬 token 價格決策。
什麼情況該用 API,什麼情況值得自建?
低流量、需求波動大或需要最快取得旗艦能力時,API 通常更省。資料不得離開內網、用量長期穩定、需要固定權重或深度客製時,自建才較有價值。請用一年期 TCO 比較 GPU、電力、機房、備援、監控與維運人力。
台灣企業可以直接採用中國來源模型嗎?
一般民間企業不能一概而論,仍須依資料分類、產業法規、客戶契約與供應鏈政策評估;公務機關則已有明確的 DeepSeek 使用限制。政府機關、關鍵基礎設施及政府標案承包商,應在 PoC 前取得資安與採購單位書面確認,並準備 Gemma、Nemotron、Muse、Mistral、gpt-oss 或 TAIDE 等替代線。
結論:追最新版本之前,先確認它是不是你的部署候選
2026 年的模型更新速度比 2024 年更快,但企業選型反而不該只追型號。Qwen3.8-27B、Nemotron 3.5 Lightning、Muse Glimmer、Gemma 4 與 TAIDE 是可實際放進地端驗收的候選;DeepSeek V4-Flash-0731、2.4T Qwen、Kimi K3 與 Nemotron 3 Ultra 雖開放權重,完整部署仍是叢集工程;GLM 5.3 目前則是先上服務而非新公開權重。真正穩健的做法,是把雲端旗艦當品質上限、中型開放權重當落地基線、自有驗收集當決策依據,再用資料治理、RAG、權限與監控補上模型本身沒有提供的企業能力。
官方資料來源: Qwen3.8-27B model card、 Qwen3.8-2.4T-A95B model card、 DeepSeek V4-Flash-0731 model card、 DeepSeek API 定價、 GLM 5.3 官方文件、 Kimi K3 官方 repository、 Nemotron 3.5 Lightning model card、 Muse Glimmer 30B model card、 Google Gemma 4、 OpenAI gpt-oss、 Mistral 3、 Gemma-3-TAIDE-12B-Chat-2602、 Open Weights and American AI Leadership。