人民網
人民網>>北京頻道

從“全球最大”到“全球榜首” 北京大模型“雙子星”閃耀全球

2026年07月18日08:07 | 來源:北京日報
訂閱已訂閱已收藏收藏小字號

  近日,北京人工智能企業月之暗面發布了目前全球參數最大的開源模型Kimi K3,參數規模達2.8萬億﹔同樣誕生在北京的智譜GLM-5.2也登上全球多份權威評測榜單的榜首,吸引了海外大量開發者使用——北京大模型領域的“雙子星”,正通過不斷迭代挑戰技術極限,具備處理更復雜任務的能力,讓AI世界裡的生產力加速“變現”。

  超大模型背后更考驗訓練能力

  目前北京備案上線的大模型達到259款。除了數量居全國首位,模型能力是否也更勝一籌?

  參數規模達2.8萬億的Kimi K3是個代表——北京不斷上線和迭代的模型,正顯露出越來越多超大模型。“大模型”與“超大模型”一字之差,但模型能力實現跨越式升級。Kimi K3具備100萬詞元上下文窗口,這相當於整面書架的書籍一次性裝進大腦,即使后面處理再復雜的任務,也不會忘記開篇的設定。

  “超大模型往往具備更強的推理能力,能夠處理更復雜的任務,進行超大模型訓練需要非常深厚的技術積累。”中關村人工智能研究院院長邵斌解釋。

  超大模型是“練”出來的。“隨著參數量的增加,模型訓練難度呈指數級增加。”月之暗面負責人解釋,從去年7月成功研發並在全球范圍內開源首個萬億參數模型,到當前即將開源的2.8萬億新一代基座模型,參數量雖然大幅增加,但模型在訓練過程中並沒有出現卡死崩盤的“爆炸”情況,確保研發工作順利進行。全球范圍內僅有極少數企業掌握此訓練方法。

  這源於底層架構方面的多項突破。月之暗面去年在萬億參數訓練時,就在全球范圍內首次大范圍使用了二階優化器,使數據學習處理效率翻了一番﹔此次Kimi K3訓練過程中,還大膽使用了原創機制,使模型訓練效率達到國外企業的近2倍。

  “這類超大規模參數模型的落地問世,顯示出北京在大模型創新研發領域處於世界第一梯隊。”邵斌說。

  兩個月就能迭代一版模型

  Kimi K3發布前,同樣來自北京的一款基礎模型——GLM-5.2也是一發布便迅速引發關注,並在全球多份權威評測榜單居榜首位置,海外開發者更為其長程任務能力點贊。

  長程任務是大模型的核心能力之一:模型不僅需要理解更長的信息,還要在持續數小時甚至更長的任務過程中保持目標、調用工具並完成多步驟操作,對模型的推理、記憶和執行能力提出了更高要求。

  GLM-5.2支持百萬詞元上下文,通過算法架構創新與工程優化,降低了訓練和推理的算力消耗。“我們期待讓模型自主且長時間地運行一個任務,實現端到端交付。”智譜總裁王紹蘭舉例,在新藥研發中,大模型可實現幾十個智能體聯合行動,加速找到靶點。該模型已經在智能體協同、工具調用等方面展現出較強的泛化能力,並在政務、金融、制造、醫療等領域加快應用落地。

  值得一提的是,這款模型還保持著每兩個月就升級一版的迭代周期,速度超越了行業平均水平。

  “下一代模型也正在研發中。”王紹蘭說,人工智能處理長程任務的能力還需要進一步提升,努力實現智能體的自主運行,賦能千行百業。

  北京開源基礎模型水平實現引領

  今年一季度,智譜大模型的全球總調用量增長了400%。“這要歸功於開源開放的策略,吸引了全球的開發者和企業用戶。從真實生產力場景中的使用效果來看,模型能力也與海外閉源模型相當。”王紹蘭解釋。

  截至2026年7月,智譜平台注冊企業及用戶突破600萬。同樣,月之暗面推出的大模型也主打向全球開發者開放,此前測試在部分項目中接近或比肩國際頂級閉源模型。

  其實,開源在計算機軟件領域歷史悠久,曾帶來了多次翻天覆地的技術革命,諸多操作系統等通過開源開放實現了快速迭代和升級。邵斌解釋,北京的大量模型都採用了開源開放的路線,吸引了全球最聰明的大腦聚在一起創新,整合各方創新力量,更容易形成合力。

  “北京的開源基礎模型實現國際引領。”市發改委相關負責人介紹,北京將持續完善政策支持體系,優化創新生態環境,加快培育智能經濟新形態,加快建設具有技術策源力和產業競爭力的全球人工智能創新高地。(記者 曹政)

(責編:李世奇、高星)

分享讓更多人看到

返回頂部