根據 DeepReinforce 最新發布的技術白皮書,開源大語言模型 Ornith-1.5 系列在 SWE-bench 程式碼建構與極限推理基準評測中,效能首度達到閉源旗艦 Claude 3.5 Sonnet 與 Opus 4.8 同等級水準。更驚人的是,其 9B 4-bit 量化輕量版本實測能在 iPhone 17 等端側裝置離線流暢運行,無需仰賴任何雲端算力。
這不是開源社群第一次喊出「超越閉源」,但絕對是第一次拿出如此完整的技術矩陣。從 3,970 億參數的 MoE 雲端巨獸,到 90 億參數的輕量稠密模型,再到專為手機打造的 4-bit 量化版本——Ornith-1.5 用三條產品線,精準對應了企業機房、私有雲端到掌上終端的所有場景。開源與閉源的技術鴻溝,正在以超乎預期的速度被填平。
自我改進循環:讓 AI 自己逼自己變強
傳統大型語言模型的預訓練與微調流程,有一個無解的結構性困境:當模型參數規模持續擴大,人工標註資料與合成資料的品質就成了天花板。業界普遍遭遇的「資料枯竭」與「邊際效應遞減」,本質上是因為人類已經無法產出足夠多的高難度邏輯推論樣本,來餵養胃口越來越大的模型。
Ornith-1.5 給出的解方是「自我改進循環(Self-Improvement Loop)」機制。概念並不複雜:讓模型在學習過程中自主探索推理邊界,主動生成難度更高、邏輯更複雜的推論任務,再透過持續性的強化學習反饋進行迭代校正。過去需要人工介入的監督微調,現在由模型自己完成閉環。根據 DeepReinforce 的技術文件,這套機制使模型在無需無休止仰賴人類數據介入的情況下,自主突破了邏輯推論的性能瓶頸。
說穿了,這套作法並非全新發明,但過去只有少數頂尖閉源實驗室有資源將它落實到大規模訓練中。Ornith-1.5 的意義在於:它證明了開源社群不僅有能力複製這條技術路徑,甚至能在參數效率上做得更極致。
編輯觀點:自我改進循環的技術細節公開,其實是 DeepReinforce 下的一步險棋。把這套機制的核心邏輯直接以 Apache 2.0 授權開源,等於是把「讓模型自主進化」的鑰匙交給了整個開源社群。從產業面來看,這會大幅加速開源模型的迭代速度,但也可能導致閉源廠商失去最關鍵的技術護城河。未來兩年內,開源與閉源的效能差距將不再是討論重點,真正的戰場會轉向「誰能用最低成本把模型塞進最多終端裝置」。
三大參數規模全線覆蓋:從雲端機房到掌上手機
DeepReinforce 這次的產品布局,顯示出明確的戰略意圖:不是做一個單點突破的技術展示,而是端出完整的生態系方案。
旗艦版 Ornith-1.5-397B 採用混合專家(MoE, Mixture-of-Experts)架構,總參數規模高達 3,970 億。實際推論時僅動態啟動特定專家網路,大幅降低算力開銷。在複雜程式碼生成與深度推理測試中,官方宣稱其表現完全媲美 Claude Opus 4.8,部分關鍵項目甚至超車。這款產品瞄準的是企業級雲端運算場景,直接挑戰閉源廠商最核心的獲利區塊。
平衡版 Ornith-1.5-35B-A3B 同樣基於 MoE 設計,總參數 350 億。這個級別的競爭尤其激烈,因為它對應的是企業私有化部署的主力市場。據 DeepReinforce 公布的測試數據,其推論速度與吞吐量全面優於同級別的 Muse-Glimmer-30B 與 Google 開源的 Gemma-4-31B。對於考慮從閉源方案遷移的企業來說,這款模型提供的算力性價比可能是最關鍵的誘因。
輕量版 Ornith-1.5-9B 是 90 億參數的稠密模型,專為邊緣運算與輕量化工作站打造。這款模型的性能表現不僅遠超同尺寸產品,甚至跨級擊敗了參數規模高達 310 億的 Gemma-4-31B。參數利用率達到前所未有的高效水準,證明了模型性能不一定只能靠堆疊參數來實現。
下表整理了三款模型的關鍵定位與目標場景:
- Ornith-1.5-397B(雲端旗艦版):3,970 億參數,MoE 架構,目標場景為企業級雲端運算,競爭對手為 Claude Opus 4.8。
- Ornith-1.5-35B-A3B(高效平衡版):350 億參數,MoE 架構,目標場景為企業私有化部署,競爭對手為 Muse-Glimmer-30B、Gemma-4-31B。
- Ornith-1.5-9B(輕量稠密版):90 億參數,稠密架構,目標場景為邊緣運算與工作站,跨級競爭 Gemma-4-31B。
9B-Mobile 量化版:AI 算力正式進入離線時代
如果說 397B 旗艦版是技術宣示,那麼 9B-Mobile 量化版本才是 Ornith-1.5 系列真正具有破壞性的產品。透過 4-bit 權重壓縮、端側 NPU 記憶體佔用優化與頻寬加速技術,這款模型在保有極高推論精度的前提下,將運行所需的記憶體門檻壓縮到智慧型手機能夠承載的範圍。
實測結果顯示,搭載最新世代晶片與神經網路引擎的 iPhone 17,以及主流 Android 旗艦機型,都能在完全離線的狀態下流暢執行複雜對話、即時長文摘要與程式碼輔助。使用者無需連網、無需支付 API 費用、更無需將任何私密數據上傳至雲端伺服器。
這項突破的戰略意義遠超技術本身。過去企業與個人對閉源 AI 服務最大的顧忌,始終是資料隱私與資安風險。Ornith-1.5-9B-Mobile 直接將 AI 推理能力搬到終端裝置本地端執行,等於從根源上消除了數據外洩的疑慮。對於金融、醫療、法律等高度監管產業來說,這可能比效能提升更具吸引力。
根據 DeepReinforce 公布的測試環境說明,9B-Mobile 版本在行動裝置上的推論延遲與功耗表現均達到實用水準。建議企業在導入前仍需依自身場域進行實機驗證,以確保符合內部資安政策與應用場景需求。
Apache 2.0 授權的戰略算計
Ornith-1.5 系列全面採用 Apache 2.0 商業友善授權,這不是一個隨興的決定。Apache 2.0 允許使用者自由使用、修改、再發布,甚至用於商業產品,唯一的條件是必須保留版權聲明與免責條款。這與 GPL 等「傳染性」授權條款截然不同,對企業採用者來說幾乎沒有法律包袱。
DeepReinforce 的盤算很清楚:用最寬鬆的授權條款,換取最廣泛的生態系採用。當越多企業將 Ornith-1.5 整合進自己的產品線,越多開發者基於這套架構進行二次開發,這個模型就越有機會成為開源 AI 的事實標準。對比 OpenAI 與 Anthropic 近期密集遊說美國政府限制中國開源模型的舉動,DeepReinforce 的開源策略幾乎是站在完全對立的光譜另一端。
黃仁勳與馬斯克近期相繼表態力挺開放生態系,並非沒有原因。當開源模型的效能已經逼近閉源旗艦,封閉生態的商業模式就會開始出現結構性的裂痕。Ornith-1.5 的出現,只是加速了這個必然發生的趨勢。
從產業面來看,Apache 2.0 授權的真正受惠者,其實是台灣的硬體製造商與系統整合業者。長期以來,台灣廠商在 AI 應用的導入上,經常面臨閉源模型授權費用過高、雲端部署有資安疑慮的兩難。Ornith-1.5 的開源策略加上端側部署能力,讓台灣業者有機會在既有硬體優勢上疊加自有 AI 應用,不需要被任何單一閉源廠商綁定。這條路如果走得通,台灣在邊緣 AI 裝置的全球供應鏈角色將會更加關鍵。
數據背後的啟示
DeepReinforce 用 Ornith-1.5 系列證明了三件事。第一,開源模型在技術效能上已經具備與頂級閉源旗艦正面對決的實力,這不是未來式,是現在進行式。第二,透過 MoE 架構與量化技術的組合,開源社群能夠在同一套基礎架構上,同時覆蓋從雲端到終端的完整算力光譜。第三,Apache 2.0 授權策略顯示開源陣營正在用更積極的商業思維,挑戰閉源廠商長期建立的生態系壁壘。
對一般使用者來說,最直接的改變是:未來在手機上免費使用頂級 AI 推理能力,不再是科幻情節。對企業決策者來說,Ornith-1.5 提供了一個擺脫雲端 API 依賴的可行性方案。而對整個 AI 產業來說,這場開源與閉源的競賽,恐怕正要進入最精彩的一段。
接下來值得觀察的,不是 Ornith-1.5 能不能在更多基準測試中擊敗 Claude,而是閉源廠商會用什麼方式來回應這波開源攻勢。降價、開放部分模型權重、還是加速推出下一代旗艦?無論如何,受益的都會是終端使用者。
下一步:你該如何參與這場開源 AI 革命?
如果你正在評估企業導入 AI 解決方案,現在是重新盤點技術選型的最佳時機。Ornith-1.5 系列的 Apache 2.0 授權代表你可以自由下載、測試、甚至基於它開發自有商業產品,完全不需要擔心授權爭議。建議先從 9B 版本開始驗證,確認推論品質與推理速度是否符合業務場景需求,再評估是否升級至 35B-A3B 或 397B 旗艦版。
如果你是一般使用者,Ornith-1.5-9B-Mobile 的出現意味著你很快就能在手機上體驗離線 AI 助理。留意 DeepReinforce 官方 GitHub 釋出的行動裝置部署工具,這將是第一批實用化端側 AI 應用的關鍵節點。
如果你在硬體或系統整合領域,現在正是布局邊緣 AI 裝置的最佳時機。Ornith-1.5 的端側部署能力,搭配台灣在半導體與終端設備的供應鏈優勢,有機會打造出全球最具競爭力的 AI 終端產品線。技術已經到位,剩下的就是執行力。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
Ornith-1.5 真的能在 iPhone 17 上離線運行嗎?
可以。Ornith-1.5-9B-Mobile 透過 4-bit 權重壓縮與 NPU 記憶體優化,實測能在 iPhone 17 及主流 Android 旗艦機型上流暢運行,完全無需連網。
Apache 2.0 授權代表我可以商用嗎?
可以。Apache 2.0 是商業友善授權條款,允許自由使用、修改、再發布甚至用於商業產品,僅需保留版權聲明與免責條款。
自我改進循環跟傳統訓練有什麼不同?
傳統訓練仰賴人工標註或合成資料進行監督微調,容易遭遇資料枯竭。自我改進循環讓模型自主生成高難度推理任務並進行迭代校正,無需持續仰賴人類數據介入。
Ornith-1.5 跟 Claude 3.5 Sonnet 比誰比較強?
根據 DeepReinforce 公布的 SWE-bench 與極限推理基準測試,397B 旗艦版表現完全媲美 Claude 3.5 Sonnet 與 Opus 4.8,部分項目甚至超越。建議企業依自身應用場景進行實機驗證。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。



