單次輸出飆破百萬詞元!Google Gemini 4 Argon 登場


科技界的軍備競賽從未停歇,當大眾仍在習慣現有大型語言模型的日常對話與基礎輔助時,Google 於 2026 年 10 月 1 日在香港正式推出,隆重發表具備前沿深度推理能力的全新旗艦模型 Gemini 4 Argon。這款專為複雜、長週期工作流程打造的前沿模型,不僅打破了傳統人工智慧在長程任務中容易出現邏輯斷層或記憶遺忘的瓶頸,更直接深入軟件工程、法律、金融等高度專業的知識領域,甚至在攸關國家與社會運作的網絡安全防禦前線,展現出令人折服的實戰效能。目前 Argon 正透過 Google 的 Fairwind 計劃,率先向一批受信任的網絡安全防禦專家開放,開啟了前沿智能的新篇章。

在核心運算與推演架構上,Gemini 4 Argon 最具突破性的進展在於將模型的輸出詞元上限從過往的 6.4 萬個,一口氣暴力提升至業界領先的 100 萬個。這項改進為模型提供了前所未有的思考緩衝區與推演空間,使其能夠在單次運算中生成數十萬個詞元,徹底實現端到端的深層推理,協助專業用戶一次到位地攻克以往難以想像的長鏈條難題。在定價策略方面,Argon 推出初期提供極具競爭力的優惠價格,每百萬個輸入詞元為 2 美元,每百萬個輸出詞元為 10 美元,快取輸入詞元更享有輸入價格 95% 的深度折扣;待優惠期過後,標準價格將調整為每百萬輸入詞元 4 美元及輸出詞元 20 美元。

這款強大工具並非僅停留在實驗室的數據堆砌,而是已經全面深度介入 Google 內部的研發與日常營運,直接改變了這家科技巨擘的工作方式。數以千計的內部員工證實,Argon 在專業編程、深度研究以及寫作質素上帶來了突破性的生產力躍升。在量子運算領域,Argon 協助研究人員最佳化量子位元與邏輯閘的時空資源配置,成功在短短數分鐘內將已發布基準效能推高 40%;在資料中心管理上,其自主代理團隊分析跨系統效能數據並套用最佳化方案,目前已釋放超過 300 TiB 記憶體,預計最終節省量將落在 500 TiB 至 1 PiB 之間。而在極為繁重的大規模程式碼庫遷移工作中,Argon 甚至肩負起將 C 與 C++ 遷移至具備記憶體安全特性的 Rust 語言,涵蓋範圍從核心程式庫擴展至擁有超過 80 萬行程式碼的 Fuchsia Zircon 核心。以開源影片解碼軟體 libgav1 為例,Argon 自主替換了 3.2 萬行 SIMD 程式碼,產出安全且能自動向量化的 Rust 程式碼,執行速度不僅比原版 Rust 快上 2.7 倍,效能更極度逼近頂尖最佳化的 C++ 版本。

在客觀的行業基準測試中,Gemini 4 Argon 展現了多維度的領先實力。在針對真實世界長週期軟體工程任務的 DeepSWE v1.1 評測中,Argon 斬獲 77.9% 的破紀錄高分,在 Vibe Code Bench 上亦達到 91.9%。更值得注意的是,在衡量對美國 GDP 貢獻度加權的專業知識工作評估 Vals Index 中,Argon 獲得 68.9% 的領先成績,並在 Vals 第二代金融智能體基準測試(Vals Finance Agent v2)中取得 65.4% 的成績,於 Harvey 法律代理基準測試(Harvey LAB)的法律研究與草擬環節取得 19.6%,大幅拉開與其他競品模型的差距。在衡量企業端到端自動化執行的 Zapier AutomationBench 測試中,Argon 亦以 51.3% 傲視群雄。此外,在長影片理解測試 LVBench 中,它憑藉 91.7% 的成績展現卓越的視覺與文件綜合處置能力,而在 256k 至 1M 的長上下文 GraphWalks BFS 測試中亦交出 84.2% 的高分成績單。

除了強大的商務與工程能力,Argon 更被賦予了前所未有的主動防禦性網絡安全實力。它具備自主探尋、驗證並修復關鍵軟體漏洞的機制,為讓專業防禦人員全面發揮其潛能,Google 特別針對特定受信任專家與內部團隊發布未設防護限制的專屬版本。目前 Wiz 已在其公益性質的 Scan for Good 計劃中深度導入 Argon,用於守護關鍵公共基礎設施;在早期的實測展示中,Argon 成功揪出了一處隱藏於全球醫院醫療保健系統內、足以洩漏敏感個人資料的致命漏洞,成功化解了先前頂尖模型皆未能察覺的重大隱患。在評估漏洞修復能力的 CWE-bench v1 測試中,Argon 以 68% 的高分並列首位;在涵蓋 20 種程式語言的原始碼漏洞掃描中取得 85.8%,在缺乏原始碼的黑箱滲透測試探測中亦取得 70.9%,均顯著超越前代 3.8 Flash Cyber。

面對如此龐大且具備雙重用途的前沿能力,Google 採取了極為嚴密的防護機制與分階段推出策略。Google 積極參與美國政府發布前的自願性評估,並在前沿安全框架下,全面強化防範化學、生物、放射性及核能等重大濫用風險,配備自動監控與紅隊對抗演練。在防範惡意間接提示詞注入(IPI)方面,Argon 在 Gray Swan 基準測試中創下僅 0.7% 的極低攻擊成功率,展現業界最佳的抗劫持穩健度。與此同時,針對模型在複雜長鏈條思考中可能出現的對齊偏差,Google 部署了針對思維鏈的即時監控阻斷措施,並在物理與虛擬環境中進一步強化沙盒隔離架構,確保模型在邁向正式開放的過程中始終安全受控。

最新內容