Kimi K3 發布一週眾生相:共識、分歧、大勢
作者:Alan、Denise|Biteye 內容團隊
AI 軍備競賽時代,一款基礎模型發布後的第一天,往往也是評價最容易失真的時候。
高光 Demo 集中出現,Benchmark 名次被反覆轉發,模型擅長的題目被放大,失敗案例則還沒有來得及浮出水面。但對於真正準備把模型放進工作流的普通用戶和開發者來說,榜單上的領先並不等於日常任務中的穩定交付。
發布一週,反而是一個更合適的觀察節點。
成功點開始被不同用戶重複驗證,白屏、返工、額度消耗、指令遺漏和工具兼容問題,也陸續出現在帖子與評論區。Kimi K3 正處在這個階段。
Kimi K3 於 2026 年 7 月 16 日發布。官方將其定義為一款 2.8T 參數、原生支持視覺輸入、擁有 100 萬 Token 上下文窗口的長程 Agent 模型。發布約三天後,用戶請求已經逼近集群容量上限,Kimi 一度暫停面向新用戶的個人訂閱,將算力優先留給現有會員。
為了盡量還原 K3 在全球開發者中的實際位置,我們系統整理了 7 月 16 日至 21 日間公開可核驗的開發者、AI KOL 與獨立媒體反饋。👇
一、全網實操總結:Kimi K3 做了哪些好玩的?
現有公開測試大致可以分為五類:視覺交互與遊戲原型、全棧開發與既有代碼庫、軟硬件系統集成、Agent 工作流與代碼安全。
1. 視覺交互與遊戲原型
這是 K3 公開案例最密集的一類,也是普通用戶最容易感知差異的部分。測試者不只看頁面是否好看,還實際檢查了相機運動、物理規則、遊戲狀態、移動端適配和多輪修改。
毒AI:7 個原創任務拆開測視覺、邏輯和調試
毒AI 設計了 7 項原創任務,分別覆蓋互動應用、3D 浮島作品集、需求衝突識別、競態條件 Bug 調試、長程定價調研、極簡視覺設計和台球物理推理。
其中,3D 浮島直接復用了此前測試 GPT-5.6 四個版本的同一條 Prompt,因此比各模型分別展示自己挑選的高光 Demo 更有可比性。任務要求使用 React 和 Three.js,實現四段滾動相機運動、懸停發光、點擊推進、Bloom、體積雲、粒子與動態天空。
K3 首輪運行出現白屏,第二輪修復後成功啟動。主體、瀑布、雲層、相機轉場和移動端特效降級基本實現,但任務耗時接近一小時,移動端仍存在排版問題。
另一項"賽博朋克地下診所"要求生成三名患者、隱藏故事線、義體零件庫存和至少三種結局。測試團隊實際走完了全部分支,確認三個結局均能到達,庫存耗盡也會改變可選診斷方案。這個項目測到的並不只是視覺生成,還包括狀態管理、分支邏輯和可玩性驗收。
來源:https://mp.weixin.qq.com/s/Qe7RfIr2z9-Qlm6Xd1pE1A?scene=1
Aditya:單 Prompt 做 MMORPG 風格原型,再與 Opus 4.8 同題對比
Aditya 的第一項任務,是用單條 Prompt 生成一個可玩的 MMORPG 風格原型。公開記錄顯示,任務耗時約 55 分鐘,費用為 9.37 美元,成品包含騎馬、屋頂跑酷、戰鬥和可探索開放世界。
第二項任務在同一 Cursor 環境中分別接入 K3 與 Opus 4.8 API,使用同一條 Prompt 生成 Crossy Road 克隆。Prompt 明確要求體素或低多邊形風格、程序化道路與河流、移動車輛、漂浮木筏、火車預警、碰撞與 Game Over、難度遞增、計分、重開、相機跟隨、60FPS 和模塊化代碼。
兩邊都做出了可玩的遊戲和可用的物理效果。K3 的 UI 略精緻,費用為 7.11 美元;Opus 的費用為 19 美元。
來源:Aditya 的測試記錄、RoundtableSpace 對 MMORPG 案例的轉述
向陽喬木:Three.js 猜色遊戲和 40 多種 UI 風格頁
在連續完成的 6 個項目中,向陽喬木讓 K3 使用 Three.js 開發 3D Mastermind 猜色遊戲。第一版已經可玩並帶有音效,後續又加入拖拽排序、小球移動軌跡、雲端數據庫和排行榜。
此外,他讓 K3 生成了包含 40 多種樣式的 UI 學習頁,覆蓋新擬態、液態玻璃和極簡主義等多種設計語言,以觀察模型在界面、空間佈局和視覺風格上的覆蓋能力。
項目體驗地址包括 Mastermind 3D 遊戲 和 UI 風格學習頁。
來源:向陽喬木完整實測
2. 全棧開發、既有代碼庫與長上下文任務
從零生成一個 Demo,只能說明模型會搭架子。讀取舊代碼、識別約束、修改多個模塊,再經過編譯、測試和部署,才更接近真實開發。
向陽喬木:給伺服器權限,連續開發並上線 6 個項目
向陽喬木給了 K3 伺服器權限,連續開發並上線 6 個項目,覆蓋前端、後端、數據庫、AI API、已有代碼庫優化和工具開發。他記錄的典型過程是一輪對話完成 MVP,再用 2 至 5 輪補功能、修界面並部署。
其中一個任務是審計既有 iOS GitHub 倉庫。K3 報告了 5 個高危漏洞、4 個性能問題和 2 個架構問題,隨後啟動 5 個 Subagent 分工修復,完成編譯並拉起 iOS 模擬器供人工體驗。
另一個任務是為微信公眾號製作 GIF 壓縮 Skill。約束條件包括文件不超過 10MB、總幀數不超過 300 幀、幀率控制在 12 至 20fps。K3 用約 10 分鐘完成工具開發,成品可以合併長時間靜止幀、刪除冗餘幀,並在滿足大小限制的同時儘量保留畫質。
該項目已經公開源碼:qiaomu-tiny-gif GitHub 倉庫
向陽喬木還把約 82 萬行 Rust 代碼分別交給 K3 與 GPT-5.6 Sol Ultra 做全量分析;另有一個 arXiv 中文檢索網站在夜間長任務中完成開發、部署和 GitHub 上傳。公開體驗地址為 arXiv 中文檢索網站。
來源:向陽喬木完整實測
3. 軟硬件系統集成
電磁波 Studio:開發並部署實時語音對話系統
電磁波 Studio 給 K3 的任務不是"生成一段語音",而是在一塊 RTX 3090 的部署環境中搭建一套實時語音對話系統。
視頻給出了各環節數據:端到端接話約 1.5 至 2.5 秒,STT 識別約 0.88 秒,LLM 首 Token 約 0.3 至 0.5 秒,TTS 首包出聲約 0.19 秒,顯存佔用約 20GB/24GB。下一步計劃是把接話延遲壓到 500 毫秒以內。
來源:電磁波 Studio 語音系統實測
4. Agent 工作流與代碼安全
Kun Chen:接入 FirstMate,觀察指令遵循和額度消耗
Kun Chen 把 K3 接入 FirstMate,連續使用了一個上午。FirstMate 的長系統提示會持續要求模型診斷問題、分派任務並遵守工作流,因此比一次性網頁 Demo 更容易暴露指令遵循問題。
他使用的是 40 美元套餐。在約 200K 上下文的單個會話中,只運行了幾個 Prompt,便消耗了一個 5 小時額度窗口的約三分之一。實操中,K3 能理解意圖、診斷問題並委派任務,但響應速度較慢,也會遺漏系統提示中的部分約束。
FirstMate 已經開源:kunchenguid/firstmate GitHub 倉庫
來源:Kun Chen 的 K3 實測
Malte Ubl:使用 Deepsec 在舊版本真實代碼庫上運行安全評測
Malte Ubl 團隊使用開源安全 Agent Harness Deepsec,在一個未公開的 open-core 應用舊 Git commit 上測試多款模型。該版本位於大量安全問題被修復之前,任務是讓模型在較大代碼庫中尋找真實漏洞,同時避免針對公開題庫刷榜。
公開結果顯示,GPT-5.6 Sol 的召回率和精度最高,但單次運行成本超過第二名的 7 倍。K3 在召回率、精度和價格之間更均衡。GLM-5.2 比 K3 便宜約 40%,但召回層級更低。
Deepsec 已經開源:vercel-labs/deepsec GitHub 倉庫
來源:Malte Ubl 的 Deepsec 私有評測
二、KOL 評價:做完以後,他們如何判斷 K3
中文 KOL:肯定視覺與工程突破,也更關注真實交付
- 向陽喬木(@vista8,AI KOL,XHunt全球AI排名:891 ):視覺與空間互動突出,但架構和後端仍需強約束
向陽喬木認為,K3 的優勢集中在互動、介面、視覺和空間場景,尤其適合需要截圖反饋和連續修正的前端工程。架構設計和後端穩定性仍不及頂級閉源模型。
他還提醒,K3 對模糊任務過於主動。使用時需要在系統提示詞或 AGENTS.md 中明確修改範圍、禁止事項和驗收標準,否則模型可能主動擴大任務邊界。
- 毒AI:能力上限很高,但完成度往往來自多輪修復
毒AI的 7 項測試顯示,K3 能同時處理視覺、邏輯、需求衝突和調試,但並非所有任務都能一輪交付。
首輪白屏、移動端排版問題和前端映射 Bug 都說明,最終成品的高完成度通常來自"生成、運行、發現問題、繼續修復",而不是第一次生成就天然可靠。視覺上限是優勢,耗時、額度消耗和首輪穩定性則是現實成本。
- 電磁波 Studio:價值在工程編排,而非單卡跑大模型
語音系統案例說明,K3 可以把語音識別、LLM、語音合成和部署環境串成一條可以測量的鏈路。
它支持"K3 具備複雜系統集成能力"的判斷,但不支持"完整 K3 可以在單張 3090 本地運行"的說法。
英文 KOL:把 K3 放進同題對比和真實 Agent 工作流
- Chris(@ChrisGPT,AI行業記者,XHunt全球AI排名:1774):長上下文有助於保持持續演化的工程軌跡
三輪加入新機制後,已有功能仍能繼續工作,使 Chris 的案例成為 1M 上下文價值的一個直觀樣本。
不過,3.24 美元只是模型調用費,不包含美術資產、玩法設計、性能測試、部署和人工驗收,也不能據此推導同類遊戲的平均成功率。
- TestingCatalog(@testingcatalog,AI情報媒體,XHunt全球AI排名:1924 ):更複雜、更吸引眼球,但不等於更可靠
TestingCatalog 的同題對比呈現出明確取捨。K3 願意實現更多視覺和互動效果,Fable 5 則完成更快,UX 組件也更穩定。
100 倍行星速度觸發的視角異常說明,"功能更多"與"可用性更高"必須分開評價。
- Kun Chen(@kunchenguid,個人開發者,XHunt全球AI排名:11462):能理解和委派任務,但日常體驗受速度與遵循性制約
Kun Chen 認可 K3 理解意圖、診斷問題和分派任務的能力,同時指出其速度慢、會漏掉長系統提示中的部分約束,而且實際套餐額度消耗並不輕。
發布初期服務擁堵可能放大了延遲,但指令遵循和額度體驗仍是比展示型 Demo 更接近日常使用的觀察。
- Malte Ubl(@cramforce,Vercel CTO,XHunt全球AI排名:1425):適合做持續安全掃描的主力,但排不到最高質量基線
Malte 的建議是先用 GPT-5.6 Sol 建立一次高質量安全基線,再用Kimi K3 做持續分析。
這意味著,Kimi K3 在該私有測試中的定位不是召回率第一,而是質量、精度和價格之間的折中方案。
- Aditya(@adxtyahq,EntelligenceAI DevRel,XHunt全球AI排名:27714):Kimi K3d的強項是一條 Prompt 內的多系統協同
Aditya 的兩個案例表明,K3 能在一次長任務中同時處理場景生成、物理規則、輸入控制和 UI 狀態,並在同一 Cursor 環境中以較低費用完成可玩的 Crossy Road 克隆。
三、共識、分歧,以及思考
一周之後,圍繞 K3 已經形成了幾項相對穩定的共識。
K3 當前最突出的能力是視覺編碼、前端、3D 和遊戲原型。
1M 上下文適合大倉庫和長任務,但不能代替上下文篩選。
響應偏慢、輸出 Token 較多,是目前最常見的負面反饋。
Agent 的最終效果高度依賴 Kimi Code、Claude Code、Cursor 等工具環境。
關鍵生產任務仍需要測試、回滾和人工驗收。
而分歧主要集中在三個問題上。
1.真的更便宜嗎?------支持者強調緩存命中後的低輸入成本,反對者強調總 Token 和返工成本。
真的接近頂級閉源模型了嗎?------視覺和前端任務中的差距較小,複雜邏輯與整體體驗仍有差距。
開放權重真能推動本地部署嗎?------定制化空間值得期待,但完整 2.8T 模型並不是普通消費級硬件可以輕鬆承載的規模。
其實,把這 10 位 KOL 的反饋放在一起,會發現大家真正爭論的,是應該用什麼標準衡量它。
Kimi K3 在前端、3D 和遊戲原型中已經給出了足夠有說服力的結果。但如果標準是複雜生產任務中的穩定交付,它仍然要面對速度、Token 效率、髒數據和異常恢復的考驗。
其實,在Agent 工作流逐漸成熟後,更合理的做法可能是拆分任務。譬如將視覺生成打包給 Kimi K3,複雜推理交給更穩定的gpt 5.6 sol或Claude fable 5,相對簡單的檢索和重複操作可以甩給輕量模型,最後再用測試和人工審核完成驗收。
在這種工作流裡,所用到的基模完全不必在所有Benchmarks上斬獲第一。只要它在一個高頻環節中形成明顯優勢,同時價格、上下文或部署方式足夠有吸引力,就能成為工作流中不可替代的一塊。
大模型的資本投入與等待周期終究是有上限的,它必須盡快轉化成生產力。
所以,Kimi K3乃至國產大模型是否會超越OpenAI與Anthropic,榜單還會繼續給出新的答案。但更值得觀察的問題已經變了:當模型之間的能力差距不斷縮小時,誰最容易被接入工具、被放進工作流、被長期調用,誰就能在這輪AI競爭中脫穎而出。
注:本文 KOL 反饋主要取自 2026 年 7 月 16 日至 21 日的公開討論,由 Biteye 進行歸類與轉述。精確成本、耗時和成功率均為個案,不構成標準化 Benchmarks。模型參數、定價、上下文、訂閱和權重開放狀態以 Kimi 官方最新信息為準。
免責聲明:本內容僅用於一般品牌傳播與資訊說明之目的,不構成任何金融、投資、法律或稅務建議。文中提及的活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售、交易任何加密資產,或使用任何服務的推薦、招攬或邀請。加密資產具有高波動性,並存在價值損失風險。WEEX 服務及線上活動的可用性可能因地區而異,並受當地適用法律法規及用戶資格要求限制。部分活動可能不適用於某些司法管轄區。您有責任確保訪問及使用 WEEX 服務符合當地適用法律法規。在參與任何涉及加密資產的活動前,請充分評估相關風險。
猜你喜歡

Gerdau 在美國的利潤超過巴西:估值差距

比特幣壓縮,山寨幣準備中 - Steady Lads

VanEck:比特幣的夏季沉寂掩蓋了供應基礎的收緊

透過婚姻詐騙獲得價值數百萬美元的加密貨幣,最終落入執法機構之手

Robinhood Chain 生態報告:交易熱度、TVL 來源、穩定幣擴張與券商演進邏輯

植物油價格上漲:全球及烏克蘭市場發生了什麼

去中心化不是理想主義

市場焦點:儘管不確定性仍然存在,卻帶來了一絲緩解

洗錢:巴基斯坦在聯邦警察內成立加密貨幣調查單位

Meta 加速其 AI 策略,但扎克伯格認為進展仍然太慢

一位美國人在中國爛尾樓中的建國實驗,宣告失敗

迪蒙避免長期股票和債券:這意味著什麼

6月新增獨角獸企業增長,但市場在AI熱潮中顯示出‘選擇性重組’的信號

CryptoQuant分析師Sunny Mom:比特幣現貨買盤依然冷清 資金仍在場外觀望

索拉納在去中心化交易所的現貨交易中保持領先地位

日本加密市場 2026 年全景:成熟之路與三大關鍵層次

Bitcoin 的機會來自貨幣化,而不是現金流




















