[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"project-93952":3},{"id":4,"name":5,"fullName":6,"owner":7,"repo":5,"description":8,"homepage":9,"htmlUrl":9,"language":9,"languages":9,"totalLinesOfCode":9,"stars":10,"forks":11,"watchers":12,"openIssues":13,"contributorsCount":13,"subscribersCount":13,"size":13,"stars1d":13,"stars7d":13,"stars30d":13,"stars90d":13,"forks30d":13,"starsTrendScore":13,"compositeScore":14,"rankGlobal":9,"rankLanguage":9,"license":15,"archived":16,"fork":16,"defaultBranch":17,"hasWiki":16,"hasPages":16,"topics":18,"createdAt":9,"pushedAt":9,"updatedAt":19,"readmeContent":20,"aiSummary":21,"trendingCount":13,"starSnapshotCount":13,"syncStatus":22,"lastSyncTime":23,"discoverSource":24},93952,"Kimi-K3","MoonshotAI\u002FKimi-K3","MoonshotAI","Open Frontier Intelligence",null,7852,566,3,0,64.26,"Other",false,"main",[],"2026-09-21 04:01:26","\u003Cdiv align=\"center\">\n  \u003Cpicture>\n      \u003Cimg src=\"assets\u002Fkimi-logo.png\" width=\"30%\" alt=\"Kimi K3\">\n  \u003C\u002Fpicture>\n\u003C\u002Fdiv>\n\u003Chr>\n\u003Cdiv align=\"center\" style=\"line-height:1\">\n  \u003Ca href=\"https:\u002F\u002Fwww.kimi.com\" target=\"_blank\">\u003Cimg alt=\"Chat\" src=\"https:\u002F\u002Fimg.shields.io\u002Fbadge\u002F🤖%20Chat-Kimi%20K3-ff6b6b?color=1783ff&logoColor=white\"\u002F>\u003C\u002Fa>\n  \u003Ca href=\"https:\u002F\u002Fwww.moonshot.ai\" target=\"_blank\">\u003Cimg alt=\"Homepage\" src=\"https:\u002F\u002Fimg.shields.io\u002Fbadge\u002FHomepage-Moonshot%20AI-white?logo=Kimi&logoColor=white\"\u002F>\u003C\u002Fa>\n\u003C\u002Fdiv>\n\n\u003Cdiv align=\"center\" style=\"line-height: 1;\">\n  \u003Ca href=\"https:\u002F\u002Fhuggingface.co\u002Fmoonshotai\" target=\"_blank\">\u003Cimg alt=\"Hugging Face\" src=\"https:\u002F\u002Fimg.shields.io\u002Fbadge\u002F%F0%9F%A4%97%20Hugging%20Face-Moonshot%20AI-ffc107?color=ffc107&logoColor=white\"\u002F>\u003C\u002Fa>\n  \u003Ca href=\"https:\u002F\u002Ftwitter.com\u002Fkimi_moonshot\" target=\"_blank\">\u003Cimg alt=\"Twitter Follow\" src=\"https:\u002F\u002Fimg.shields.io\u002Fbadge\u002FTwitter-Kimi.ai-white?logo=x&logoColor=white\"\u002F>\u003C\u002Fa>\n  \u003Ca href=\"https:\u002F\u002Fdiscord.gg\u002FTYU2fdJykW\" target=\"_blank\">\u003Cimg alt=\"Discord\" src=\"https:\u002F\u002Fimg.shields.io\u002Fbadge\u002FDiscord-Kimi.ai-white?logo=discord&logoColor=white\"\u002F>\u003C\u002Fa>\n  \u003Ca href=\"https:\u002F\u002Fmodelscope.cn\u002Forganization\u002Fmoonshotai\" target=\"_blank\">\u003Cimg alt=\"ModelScope\" src=\"https:\u002F\u002Fimg.shields.io\u002Fbadge\u002FModelScope-Moonshot%20AI-white?labelColor=rgb(99%2C%2074%2C%255)\"\u002F>\u003C\u002Fa>\n\u003C\u002Fdiv>\n\u003Cdiv align=\"center\" style=\"line-height: 1;\">\n  \u003Ca href=\"https:\u002F\u002Fhuggingface.co\u002Fmoonshotai\u002FKimi-K3\u002Fblob\u002Fmain\u002FLICENSE\">\u003Cimg alt=\"License\" src=\"https:\u002F\u002Fimg.shields.io\u002Fbadge\u002FLicense-Kimi_K3-f5de53?&color=f5de53\"\u002F>\u003C\u002Fa>\n\u003C\u002Fdiv>\n\n\n\u003Cp align=\"center\">\n📰&nbsp;&nbsp;\u003Ca href=\"https:\u002F\u002Fwww.kimi.com\u002Fblog\u002Fkimi-k3\">Tech Blog\u003C\u002Fa> | &nbsp;&nbsp;&nbsp; \u003Cb>📄&nbsp;&nbsp;\u003Ca href=\"k3_tech_report.pdf\">Full Report\u003C\u002Fa>\u003C\u002Fb>\n\u003C\u002Fp>\n\n\n## 1. Model Introduction\n\nKimi K3 is an open-weight, native multimodal agentic model and our most capable model to date. It is a 2.8T-parameter model built on Kimi Delta Attention (KDA) and Attention Residuals (AttnRes), with native vision capabilities and a 1-million-token context window. It is the world's first open 3T-class model, designed for frontier intelligence across long-horizon coding, knowledge work, and reasoning.\n\n### Key Features\n- **New Architecture**: Kimi K3 is built on Kimi Delta Attention (KDA) and Attention Residuals (AttnRes), and scales up MoE sparsity with a Stable LatentMoE framework that activates 16 out of 896 experts — yielding an approximate 2.5× improvement in overall scaling efficiency over Kimi K2.\n- **Long-Horizon Coding**: Operating with minimal human oversight, Kimi K3 sustains long engineering sessions, navigates massive repositories, and orchestrates terminal tools — from GPU kernel optimization and compiler development to vision-in-the-loop game dev, CAD, and even chip design.\n- **Agentic Knowledge Work**: Kimi K3 advances end-to-end knowledge work, producing deep research with interactive visualizations, widgets and dashboards, and motion design and video editing, powered by its native multimodal architecture.\n- **Native Multimodality & Long Context**: Kimi K3 understands text, images, and video within the same model, and supports a 1-million-token context window.\n- **Open Frontier Weights**: We release the full Kimi K3 model weights under the Kimi K3 License, making frontier intelligence openly available for research, deployment, and further innovation.\n## 2. Model Summary\n\n\u003Cdiv align=\"center\">\n\u003Ctable>\n\u003Ctbody>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Architecture\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Mixture-of-Experts (MoE)\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Total Parameters\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">2.8T\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Activated Parameters\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">104B\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Number of Layers\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">93\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Number of Dense Layers\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Attention-Layer Composition\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">69 KDA + 24 Gated MLA\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Attention Hidden Dimension\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">7168\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Number of Attention Heads\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">96\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Latent MoE Dimension\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">3584\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>MoE Hidden Dimension\u003C\u002Fstrong> (per Expert)\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">3072\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Number of Experts\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">896\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Selected Experts per Token\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">16\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Number of Shared Experts\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">2\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Vocabulary Size\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">160K\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Context Length\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1048576\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Attention Mechanism\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">KDA &amp; Gated MLA\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Activation Function\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">SiTU-GLU\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Vision Encoder\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">MoonViT-V2\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Parameters of Vision Encoder\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">401M\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Quantization\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">MXFP4 weights \u002F MXFP8 activations\u003Cbr>(quantization-aware training)\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">\u003Cstrong>Modality\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Text, Image\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003C\u002Ftbody>\n\u003C\u002Ftable>\n\u003C\u002Fdiv>\n\n\n## 3. Evaluation Results\n\n\u003Cdiv align=\"center\">\n\u003Ctable>\n\u003Cthead>\n\u003Ctr>\n\u003Cth align=\"center\" style=\"text-align: center\">Benchmark\u003C\u002Fth>\n\u003Cth align=\"center\" style=\"text-align: center\">\u003Csup>Kimi K3\u003Cbr>\u003Csup>(max)\u003C\u002Fsup>\u003C\u002Fsup>\u003C\u002Fth>\n\u003Cth align=\"center\" style=\"text-align: center\">\u003Csup>Claude Fable 5\u003Cbr>\u003Csup>(max, w\u002F fallback)\u003C\u002Fsup>\u003C\u002Fsup>\u003C\u002Fth>\n\u003Cth align=\"center\" style=\"text-align: center\">\u003Csup>GPT-5.6 Sol\u003Cbr>\u003Csup>(max)\u003C\u002Fsup>\u003C\u002Fsup>\u003C\u002Fth>\n\u003Cth align=\"center\" style=\"text-align: center\">\u003Csup>Claude Opus 4.8\u003Cbr>\u003Csup>(max)\u003C\u002Fsup>\u003C\u002Fsup>\u003C\u002Fth>\n\u003Cth align=\"center\" style=\"text-align: center\">\u003Csup>GPT-5.5\u003Cbr>\u003Csup>(xhigh)\u003C\u002Fsup>\u003C\u002Fsup>\u003C\u002Fth>\n\u003Cth align=\"center\" style=\"text-align: center\">\u003Csup>GLM-5.2\u003Cbr>\u003Csup>(max)\u003C\u002Fsup>\u003C\u002Fsup>\u003C\u002Fth>\n\u003C\u002Ftr>\n\u003C\u002Fthead>\n\u003Ctbody>\n\u003Ctr>\n\u003Ctd align=\"center\" colspan=7 style=\"text-align: center\">\u003Cstrong>Reasoning &amp; Knowledge\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">GPQA Diamond\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">93.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">92.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">94.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">91.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">93.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">91.2\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">CritPt\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">23.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">28.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">32.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">20.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">27.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">20.9\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">AA-LCR\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">74.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">70.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">73.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">67.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">74.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">71.3\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">HLE-Full\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">43.5 \u002F 56.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">53.3 \u002F 63.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">44.5 \u002F 58.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">49.8 \u002F 57.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">41.4 \u002F 52.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" colspan=7 style=\"text-align: center\">\u003Cstrong>Coding\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">DeepSWE\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">67.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">70.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">73.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">59.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">67.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">46.2\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">ProgramBench\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">77.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">76.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">77.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">71.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">70.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">63.7\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Terminal-Bench 2.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">88.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">88.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">88.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">84.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">83.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">82.7\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">FrontierSWE\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">81.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">86.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">71.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">66.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">64.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">67.3\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">SWE-Marathon\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">42.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">35.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">39.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">40.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">14.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">13.0\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">PostTrainBench\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">36.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">41.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">34.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">34.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">28.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">34.3\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">MLS-Bench-Lite\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">48.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">49.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">46.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">42.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">35.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">40.4\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">SciCode\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">58.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">60.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">56.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">53.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">56.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">50.5\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Kimi Code Bench 2.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">72.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">76.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">64.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">71.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">69.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">64.2\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" colspan=7 style=\"text-align: center\">\u003Cstrong>Agentic\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">BrowseComp\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">91.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">88.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">90.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">84.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">84.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">DeepSearchQA (F1)\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">95.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">94.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">93.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">ResearchRubrics\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">76.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">73.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">73.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">64.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">71.1\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">GDPval-AA v2 (Elo)\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1686\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1747\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1736\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1593\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1491\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1510\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Toolathlon-Verified\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">76.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">77.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">74.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">76.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">73.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">59.9\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">MCPMark-Verified\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">94.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">87.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">92.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">76.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">92.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">MCP-Atlas\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">84.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">84.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">83.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">83.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">82.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">82.6\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">AutomationBench\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">30.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">29.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">29.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">27.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">22.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">12.9\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">JobBench\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">54.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">57.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">45.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">48.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">38.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">43.4\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">AA-Briefcase (Elo)\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1548\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1583\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1495\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1354\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1158\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">1260\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Agents' Last Exam\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">28.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">25.7\u003Csup>†\u003C\u002Fsup>\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">29.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">27.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">26.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">20.4\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">APEX-Agents\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">41.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">43.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">39.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">39.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">38.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">35.6\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">OfficeQA Pro\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">63.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">69.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">63.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">63.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">60.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">41.4\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">SpreadsheetBench 2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">34.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">34.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">32.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">31.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">29.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">28.1\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">OSWorld-Verified\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">84.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">85.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">83.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">83.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">79.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">OSWorld 2.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">58.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">66.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">62.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">55.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">49.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">SaaS-Bench\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">60.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">61.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">56.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">43.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">τ³-Banking\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">33.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">26.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">33.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">27.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">31.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">26.8\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Harvey Lab-AA\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">94.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">93.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">87.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">91.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">86.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">91.0\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">CorpFin v2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">71.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">71.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">64.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">66.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">68.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">66.1\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Finance Agent v2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">54.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">56.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">53.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">53.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">51.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">49.7\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Legal Research Bench\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">44.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">49.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">48.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">43.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">40.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">31.3\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" colspan=7 style=\"text-align: center\">\u003Cstrong>Vision\u003C\u002Fstrong>\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">WorldVQA ForceAnswer\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">51.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">56.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">41.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">39.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">38.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">OmniDocBench\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">91.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">89.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">85.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">87.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">89.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">PerceptionBench\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">58.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">57.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">59.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">47.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">55.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">Video-MME (w. sub)\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">90.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">89.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">86.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">89.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">MMVU\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">82.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">81.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">79.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">81.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">BabyVision w\u002F python\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">85.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">90.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">88.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">81.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">83.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">MMMU-Pro\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">81.6 \u002F 83.4\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">81.2 \u002F 86.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">83.0 \u002F 84.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">78.9 \u002F 82.7\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">81.2 \u002F 83.2\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">CharXiv (RQ)\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">84.8 \u002F 91.3\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">88.9 \u002F 93.5\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">84.6 \u002F 89.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">80.5 \u002F 89.9\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">84.1 \u002F 89.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">MathVision\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">94.3 \u002F 97.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">94.8 \u002F 98.6\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">95.8 \u002F 97.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">86.7 \u002F 97.1\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">92.2 \u002F 96.8\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003Ctr>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">ZeroBench (pass@5)\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">23.0 \u002F 41.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">23.0 \u002F 46.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">17.0 \u002F 35.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">17.0 \u002F 34.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">22.0 \u002F 41.0\u003C\u002Ftd>\n\u003Ctd align=\"center\" style=\"vertical-align: middle; text-align: center\">—\u003C\u002Ftd>\n\u003C\u002Ftr>\n\u003C\u002Ftbody>\n\u003C\u002Ftable>\n\u003C\u002Fdiv>\n\n\u003Cdetails>\n\u003Csummary>\u003Cb>Footnotes\u003C\u002Fb>\u003C\u002Fsummary>\n\nAll Kimi K3 results are obtained with reasoning effort set to 'max' and temperature = 1.0. For single-step tasks, such as GPQA Diamond, HLE-Full, and vision benchmarks without tools, we set top-p = 0.95; for agentic tasks, we set top-p = 1.0. For HLE-Full, MMMU-Pro, CharXiv (RQ), MathVision, and ZeroBench, each cell reports the scores without and with tool augmentation (general tools for HLE-Full, Python for the vision benchmarks), in that order.\n\n1. **Reasoning & knowledge benchmarks**\n   - **CritPt and AA-LCR.** Scores are cited from [Artificial Analysis](https:\u002F\u002Fartificialanalysis.ai\u002F) as of July 23, 2026.\n2. **Coding benchmarks**\n   - **DeepSWE.** Kimi K3 is evaluated with the Kimi Code harness. The GLM-5.2 score is taken from the [GLM-5.2 release blog](https:\u002F\u002Fz.ai\u002Fblog\u002Fglm-5.2); all remaining scores are from the official [DeepSWE leaderboard](https:\u002F\u002Fdeepswe.datacurve.ai\u002F), under which Kimi K3 attains 67.3 with the mini-SWE-agent harness. We report the DeepSWE v1.1 tasks.\n   - **Terminal-Bench 2.1.** Kimi K3 is evaluated with the Kimi Code harness. For all other models, we report the best score across harnesses: GLM-5.2 with Claude Code ([GLM-5.2 release blog](https:\u002F\u002Fz.ai\u002Fblog\u002Fglm-5.2)); Claude Opus 4.8 and Claude Fable 5 with Terminus 2 ([Artificial Analysis](https:\u002F\u002Fartificialanalysis.ai\u002Fevaluations\u002Fterminalbench-v2-1)); GPT-5.5 and GPT-5.6 Sol with Codex ([OpenAI](https:\u002F\u002Fopenai.com\u002Findex\u002Fpreviewing-gpt-5-6-sol\u002F)).\n   - **ProgramBench.** Kimi K3 is evaluated with the Kimi Code harness. The GLM-5.2 score is from the [GLM-5.2 release blog](https:\u002F\u002Fz.ai\u002Fblog\u002Fglm-5.2); all other scores are from [Vals AI](https:\u002F\u002Fwww.vals.ai\u002Fbenchmarks\u002Fprogrambench).\n   - **SWE-Marathon.** Kimi K3, Claude Opus 4.8, and Claude Fable 5 are evaluated with the Claude Code harness; GPT-5.6 Sol is evaluated with the Codex harness. The GLM-5.2 score is from the [GLM-5.2 release blog](https:\u002F\u002Fz.ai\u002Fblog\u002Fglm-5.2). Our evaluation is based on an H20-calibrated branch of the [official tasks](https:\u002F\u002Fwww.swe-marathon.org\u002F) as of July 9, 2026, prior to the final v1.1 release: the Docker images, performance gates, and reference oracles for the GPU tasks have been recalibrated for H20, while the correctness and anti-cheat validators remain unchanged. Additionally, Claude Fable 5 hit fallbacks on 35% of the tasks in our evaluation, which may have negatively impacted its measured performance.\n   - **FrontierSWE.** Kimi K3 is evaluated with the Kimi Code harness and GPT-5.6 Sol with the Codex harness; all other results are from [FrontierSWE](https:\u002F\u002Fwww.frontierswe.com\u002F). Dominance scores are recomputed from the raw scores using the official evaluation script and are current as of July 16, 2026.\n   - **PostTrainBench.** Scores for GLM-5.2, GPT-5.5, and Claude Opus 4.8 are adopted from the official [PostTrainBench](https:\u002F\u002Fposttrainbench.com\u002F) results. Kimi K3, Claude Fable 5, and GPT-5.6 Sol are evaluated with the official Harbor implementation at maximum reasoning effort, averaged over three runs on H20 GPUs (instead of H100 in the official setting) — Kimi K3 and Claude Fable 5 with the Claude Code harness, and GPT-5.6 Sol with the Codex harness.\n   - **MLS-Bench-Lite.** Kimi K3 is evaluated with the Kimi Code harness; GLM-5.2 and the Claude models with the Claude Code harness; GPT-5.5 and GPT-5.6 Sol with the Codex harness.\n   - **SciCode.** Scores are cited from [Artificial Analysis](https:\u002F\u002Fartificialanalysis.ai\u002F) as of July 23, 2026.\n   - **Kimi Code Bench 2.0 (in-house).** Kimi K3 is evaluated with the Kimi Code harness (it attains 73.7 with the Claude Code harness); GLM-5.2, Claude Opus 4.8, and Claude Fable 5 with the Claude Code harness; GPT-5.5 and GPT-5.6 Sol with the Codex harness. All models are evaluated at maximum reasoning effort, except GPT-5.5, which uses the \"xhigh\" setting. As the benchmark includes cybersecurity and safety-related tasks, we also disclose the fraction of refused or fallback tasks: Claude Fable 5 hit 13 fallbacks and 1 refusal out of 80 tasks; 10 refusals out of 80 tasks entered GPT-5.6 Sol's cyber guard; GPT-5.5 had 3 refusals out of 80 tasks.\n3. **Agentic benchmarks**\n   - **OfficeQA Pro.** Each test case provides the agent with the entire PDF corpus, with all PDFs rendered as images and no machine-readable text available.\n   - **OfficeQA Pro and SpreadsheetBench 2.** Kimi K3, GLM-5.2, Claude Opus 4.8, and Claude Fable 5 are evaluated with the Claude Code harness; GPT-5.5 and GPT-5.6 Sol are evaluated with the Codex harness.\n   - **MCP-Atlas.** All models are evaluated on the 500-task public subset with a 100-turn limit, using Gemini 3.1 Pro as the judge.\n   - **AutomationBench.** All models are evaluated on the 600-task public subset, following the official GitHub setup in all other respects.\n   - **BrowseComp.** We adopt a context-compaction strategy triggered at 300K tokens. When evaluated with the full 1M-token context window and no context management, Kimi K3 achieves a score of 90.4. The results of Claude Fable 5, Claude Opus 4.8, GPT-5.6 Sol, and GPT-5.5 are cited from [Anthropic](https:\u002F\u002Fwww.anthropic.com\u002Fnews\u002Fclaude-fable-5-mythos-5) and [OpenAI](https:\u002F\u002Fopenai.com\u002Findex\u002Fgpt-5-6\u002F).\n   - **GDPval-AA v2, AA-Briefcase, τ³-Banking, Harvey Lab-AA, and APEX-Agents.** Scores are cited from [Artificial Analysis](https:\u002F\u002Fartificialanalysis.ai\u002F) and the [APEX-Agents leaderboard](https:\u002F\u002Fwww.mercor.com\u002Fapex\u002Fapex-agents-leaderboard\u002F) as of July 23, 2026. For Harvey Lab-AA, we report the criterion pass rate.\n   - **CorpFin v2, Finance Agent v2, and Legal Research Bench.** Scores are cited from [Vals AI](https:\u002F\u002Fwww.vals.ai\u002F).\n   - **Agents' Last Exam.** Scores are cited from the [official leaderboard](https:\u002F\u002Fagents-last-exam.org\u002Fleaderboard) as of July 23, 2026; we report the leaderboard's primary pass-rate metric. On the leaderboard, each model is paired with a specific harness: Kimi K3 with Kimi Code; GPT-5.6 Sol and GPT-5.5 with Codex; Claude Fable 5, Claude Opus 4.8, and GLM-5.2 with Claude Code. \u003Csup>†\u003C\u002Fsup> The Claude Fable 5 entry runs at xhigh effort with 40% of tasks annotated as downgraded.\n4. **Multimodal benchmarks**\n   - Except for ZeroBench, which follows the official setting and is run five times, all multimodal scores are averaged over three runs. MMMU-Pro is evaluated following the official protocol, preserving the original input order and prepending images to the text input.\n   - **PerceptionBench** is an in-house benchmark that focuses on atomic visual perception capabilities.\n\n\u003C\u002Fdetails>\n\n## 4. Native MXFP4 Quantization\n\nKimi K3 applies quantization-aware training from the SFT stage onward, using MXFP4 weights with MXFP8 activations for broad hardware compatibility.\n\n## 5. Deployment\n\n> [!Note]\n> You can access Kimi K3's API on https:\u002F\u002Fplatform.kimi.ai by selecting `kimi-k3`, and we provide OpenAI\u002FAnthropic-compatible API for you. Currently, Kimi K3 is recommended to run on the following inference engines:\n\n- [vLLM](https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm) — see [recipes](https:\u002F\u002Frecipes.vllm.ai\u002Fmoonshotai\u002FKimi-K3)\n- [SGLang](https:\u002F\u002Fgithub.com\u002Fsgl-project\u002Fsglang) — see [cookbook](https:\u002F\u002Fdocs.sglang.io\u002Fcookbook\u002Fautoregressive\u002FMoonshotai\u002FKimi-K3)\n- [TokenSpeed](https:\u002F\u002Flightseek.org\u002Ftokenspeed) — see [recipes](https:\u002F\u002Flightseek.org\u002Ftokenspeed\u002Frecipes\u002Fmodels#kimi-k3)\n\n---\n## 6. Model Usage\n\nKimi K3 always has thinking enabled, and will return `reasoning_content`. Thinking effort is configured with the top-level `reasoning_effort` request field, which supports `\"low\"`, `\"high\"`, and `\"max\"` (default `\"max\"`).\n\nKimi K3 was trained in the preserved thinking history mode. For multi-turn conversations and tool calls, Kimi K3 requires the complete assistant message returned by the API to be passed back to `messages` as-is — including `reasoning_content` and `tool_calls`, not just `content`:\n\n```python\nimport openai\n\ndef chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):\n    messages = [\n        {\n            \"role\": \"user\",\n            \"content\": \"Tell me three random numbers.\"\n        },\n        {\n            \"role\": \"assistant\",\n            \"reasoning_content\": \"I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.\",\n            \"content\": \"473, 921, 235\"\n        },\n        {\n            \"role\": \"user\",\n            \"content\": \"What are the other two numbers you have in mind?\"\n        }\n    ]\n\n    response = client.chat.completions.create(\n        model=model_name,\n        messages=messages,\n        stream=False,\n        max_tokens=4096,\n        reasoning_effort=\"max\",\n    )\n    # the assistant should mention 215 and 222 that appear in the prior reasoning content\n    print(f\"response: {response.choices[0].message.reasoning}\")\n    return response.choices[0].message.content\n```\n\nFor full guides and examples (vision input, structured output, partial mode, tool choice, dynamic tool loading, context caching), see the [Kimi K3 Quickstart](https:\u002F\u002Fplatform.kimi.ai\u002Fdocs\u002Fguide\u002Fkimi-k3-quickstart) and [Thinking Effort](https:\u002F\u002Fplatform.kimi.ai\u002Fdocs\u002Fguide\u002Fuse-thinking-effort).\n\n### Coding Agent Framework\n\nKimi K3 works best with [Kimi Code CLI](https:\u002F\u002Fwww.kimi.com\u002Fcode) as its agent framework. We warmly invite you to give it a try — run Kimi Code in your terminal and select Kimi K3 using the `\u002Fmodel` command. We hope you enjoy building with Kimi K3, and we would love to hear your feedback!\n\n\n---\n\n## 7. License\n\nBoth the code repository and the model weights are released under the [Kimi K3 License](LICENSE).\n\n---\n\n## 8. Contact Us\n\nIf you have any questions, please reach out at [support@moonshot.ai](mailto:support@moonshot.ai).\n","Kimi K3 是一个开源权重的原生多模态智能体模型，具备百万级上下文窗口与2.8万亿参数规模。其核心技术包括自研的Kimi Delta Attention（KDA）和Attention Residuals（AttnRes）架构，结合Stable LatentMoE稀疏激活机制，在长程代码生成、复杂知识工作与跨模态推理任务中表现突出。支持视觉理解、终端工具调用、交互式可视化及视频\u002F运动设计等原生多模态能力。适用于需要超长上下文建模、自主工程协作、科研分析与多模态内容生成的前沿AI研发场景。",2,"2026-07-28 02:30:07","CREATED_QUERY"]