【yabo.com官網入口科技消息】6月9日,MiMo×TileRT聯合發布Xiaomi MiMo-V2.5-Pro的UltraSpeed模式。通過模型與系統的極致協同設計(Codesign),在通用GPU上首次將萬億參數(1T)模型的生成速度突破1000tokens/s。據悉,UltraSpeed模式采用限時開放、申請制體驗。API同步上線,定價為MiMo-V2.5-Pro的3倍,同時提供輸出速度約10倍的提升(僅支持API體驗,不支持TokenPlan)。由于高速推理資源供給有限,本次體驗時間僅限2026年6月9日至6月23日23:59。每個賬號每日最多成功進入隊列10次,單次會話時長上限30分鐘,空閑超5分鐘自動釋放資源。

在萬億參數尺度上突破1000tps,帶來AI應用范式的底層顛覆:
速度轉化為智能:在相同等待時間內,模型可并行跑數十條推理路徑(Best-of-N/Tree Search),自動驗證糾錯,提升推理質量。
解放Coding Agent:極速推理讓開發者告別等待,實現顛覆性的代碼編寫速度與生產效率。
萬億模型進入實時決策閉環:毫秒級響應可接入高頻量化交易、瞬時反欺詐風控、智能競價、實時交互對話,乃至手術輔助、醫療影像分析等生命垂危場景——速度成為與死神賽跑的籌碼。

實現1T旗艦模型突破1000tps,是MiMo模型與TileRT系統團隊深度協作、極致Codesign的成果。業界追求類似速度時往往選擇專用硬件(如Cerebras晶圓級集成、Groq定制芯片),而 MiMo×TileRT僅在標準通用GPU上,通過一個8卡節點便實現了這一速度。
模型側:
FP4量化:針對MoE架構特性,僅對MoE Expert進行FP4量化(經QAT量化感知訓練),大幅縮減模型體積、榨干硬件帶寬,同時保持模型能力基本持平。
DFlash投機解碼:采用塊級masked并行預測方法,draft模型一次前向填出一整塊mask位置,解除串行約束。結合滑動窗口注意力(SWA),使draft不再依賴完整前綴,算力從線性增長變為常數級。在coding場景中平均接受長度達6.30,最高7.14。
系統側:
TileRT執行模型:引入常駐內核引擎(Persistent Engine Kernel),拋棄逐算子啟動模式,讓計算流水線常駐GPU內部持續流轉,實現數據搬運與計算極致重疊。
異構流水線協作(Warp Specialization):在Tile級別將通信、搬運、張量計算精細拆解,讓不同線程束精密協作,將GPU演化為持續流動的異構執行系統。
軟硬件深度收斂:TileRT配合FP4量化與DFlash算法,量身定制編譯引擎與計算核,實現微秒級尺度下的聯合工程優化。
版權所有,未經許可不得轉載
-yabo.com官網入口