Xiaomi MiMo-V2.6-Flash API 接口、参数 & 代码示例
xiaomi/mimo-v2.6-flash
MiMo-V2.6-Flash 是小米发布新一代面向高频调用和规模化任务打造的高效推理模型。与定位旗舰性能的 V2.6-Pro 不同,Flash 更强调**能力、效率与成本之间的平衡**。MiMo-V2.6-Flash 保留了 MiMo-V2.6 的核心能力体系,包括原生全模态理解、深度思考、工具调用、超长上下文和 Agent 能力,同时通过更轻量的模型结构与训练策略,降低大规模实际使用时的推理成本。
- 模型 ID
- xiaomi/mimo-v2.6-flash
- 模型系列
- MiMo
- 更新日期
- 模型能力
- 文本生成、深度思考
- 上下文长度
- 1024 K
- 模型价格(每 1000 tokens 输入)
- ¥ 0.001
- 模型价格(每 1000 tokens 输出)
- ¥ 0.002
Xiaomi MiMo-V2.6-Flash 模型介绍:
MiMo-V2.6-Flash 是小米发布新一代面向高频调用和规模化任务打造的高效推理模型。与定位旗舰性能的 V2.6-Pro 不同,Flash 更强调能力、效率与成本之间的平衡。MiMo-V2.6-Flash 保留了 MiMo-V2.6 的核心能力体系,包括原生全模态理解、深度思考、工具调用、超长上下文和 Agent 能力,同时通过更轻量的模型结构与训练策略,降低大规模实际使用时的推理成本。
MiMo-V2.6-Flash 的定位为:
“全模态、高智能、低成本的高效推理模型,面向专业办公中的高频调用与规模化任务的最佳均衡之选。”
不只是更轻量,而是重新定义“高效”
很多模型的 Flash 版本,核心思路是牺牲一部分能力换取更低的成本。
MiMo-V2.6-Flash 的设计目标则更加明确:在真实工作流中保持较强的任务完成能力,同时减少完成任务所需要的 Token 和计算开销。
小米将这种定位概括为 Pareto 前沿——官方称,Flash 在真实工作流中的体验可以比肩主流 Pro 级模型,同时具有更好的 Token 效率。这里属于小米对产品表现的官方定位,并非一个独立机构给出的统一行业排名。
因此,它更适合这样的使用方式:
大量用户请求
↓
长上下文处理
↓
模型推理
↓
工具调用
↓
完成任务
重点不是让每一次调用都使用最高规格的计算资源,而是让模型能够以更低的单位成本持续完成大量任务。
原生全模态:文本、图片、视频、音频统一理解
MiMo-V2.6-Flash 最核心的能力之一,是原生全模态理解。
模型支持:
文本、图像、视频、音频输入
最终输出则为文本。
这意味着它不是一个单纯的文本模型再外挂一个视觉模块,而是将不同模态的信息纳入统一的模型体系。
例如,用户可以同时提供:
一份文字需求 + 一张设计稿 + 一段产品演示视频
让模型分析其中的问题、提取关键信息,再输出修改建议、代码或者执行计划。
同样,它也可以处理视频内容、音频内容与文本指令结合的任务,从而适用于更复杂的多模态 Agent 工作流。
官方技术报告显示,MiMo-V2.6-Flash-RL 配备 681M 参数的 MiMo ViT 视觉编码器,以及由 308M 参数 AudioTokenizer 和 127M 参数音频 Patch Encoder组成的音频编码部分。
1M Token 超长上下文
MiMo-V2.6-Flash 支持 1M Token 上下文窗口,最大输出长度为 128K Token。
这使它能够处理远超普通对话长度的任务。
例如:
大型代码仓库
项目源码
+
依赖文件
+
测试代码
+
Git 历史
+
需求文档
可以放在同一个长上下文中,由模型持续分析。
又或者在 Agent 场景里:
用户任务
↓
工具调用
↓
网页内容
↓
中间结果
↓
错误日志
↓
再次调用工具
↓
最终结果
整个过程都可以持续保存在一个长上下文中。
小米明确将 1M Context 的使用场景指向大型代码仓库、Tool Trace、多 Session Agent 运行,以及多模态混合输入。
深度思考与 Agent 能力
MiMo-V2.6-Flash 并不是只追求快速回答,而是支持深度思考。
官方 API 默认开启 Thinking,可以按照任务复杂程度进行推理;也可以通过 API 参数关闭。深度思考主要用于复杂推理、代码生成、数学计算以及多步骤分析等任务。
与此同时,模型原生支持:
工具调用、联网搜索、结构化输出、流式输出和上下文缓存。
这意味着它可以从:
“回答一个问题”
进一步走向:
“理解任务 → 规划步骤 → 使用工具 → 获取结果 → 继续推理 → 完成任务”。
这也是 MiMo-V2.6-Flash 与传统聊天模型最大的产品形态差异之一。
真正的核心升级:强化学习规模化
MiMo-V2.6 系列此次发布的重点,并不只是模型架构本身,而是强化学习规模的进一步扩大。
小米把这次 MiMo-V2.6 的训练路线概括为:
Scaling Reinforcement Learning Toward Self-Improvement
即通过扩大 RL 算力、任务环境和评测/奖励计算,让模型在真实任务环境中不断探索、试错和获得反馈。
对于 Flash,官方技术报告特别强调了一个思路: You Only RL Once
它并不是针对代码、通用 Agent、视觉 Agent 和网络安全分别进行完全独立的 RL,而是将多个领域的任务混合在同一次 RL 流程中训练。
不同任务、不同 Harness 被放到同一个训练环境里,让一个领域中学到的策略能够向其他领域迁移。官方还希望这种训练方式能够提升模型在训练时没有见过的 Harness上的泛化能力。
让模型自己比较“哪些完成方式更好”
MiMo-V2.6-Flash-RL 的训练还有一个比较有特色的设计。
传统强化学习通常容易变成:
完成任务 → 成功
没有完成 → 失败
但对于 Agent 任务而言,两个方案都“成功”,并不代表它们质量相同。
比如:
方案 A:20 步完成,消耗 100K tokens
方案 B:8 步完成,消耗 30K tokens
如果只看最终是否成功,两者都可能得到同样的奖励。
因此,MiMo-V2.6 引入了 Groupwise Agentic Grading。模型会把同一个任务产生的多个结果放在一起比较,由 Agentic Grader 建立任务级评价标准,并进一步对“成功但质量更高”的轨迹进行区分。
官方称,这套机制旨在推动模型走向更短的任务路径和更低的 Token 消耗。
这与 Flash 的产品定位高度一致:
不仅完成任务,还希望用更少的资源完成任务。
309B 参数,但只激活 15B
从模型规模来看,MiMo-V2.6-Flash 采用 Sparse MoE(稀疏专家混合)架构:
| 指标 | MiMo-V2.6-Flash-RL |
|---|---|
| 总参数量 | 309B |
| 激活参数量 | 15B |
| 架构 | Sparse MoE |
| 最大上下文 | 1M tokens |
| 最大输出 | 128K tokens |
| 输入 | 文本 / 图像 / 视频 / 音频 |
| 输出 | 文本 |
也就是说,模型拥有 309B 总参数,但单次计算只激活其中约 15B 参数。
这正是 MoE 架构的价值之一:
模型总容量可以做得很大,但每次推理不需要让所有专家同时参与。
因此,Flash 可以在拥有较大模型容量的同时,尽量控制单次推理所需要的计算资源。
Hybrid Attention:专门针对长上下文做效率优化
MiMo-V2.6-Flash 的语言模型 Backbone 一共有 48 层:
- 39 层 Sliding Window Attention(SWA)
- 9 层 Global Attention(GA)
SWA 窗口大小为 128。
模型共有 256 个 Routed Experts,每次激活 8 个专家。
简单来说,大多数层主要关注当前位置附近的信息,同时用少数 Global Attention 层承担更远距离的信息交互。
对于 1M Token 这种规模的上下文而言,这种设计可以避免每一层都以最高成本处理全部上下文,从架构层面兼顾长上下文能力与推理效率。
MTP:进一步提高生成效率
MiMo-V2.6-Flash 还使用了 5 层 Multi-Token Prediction(MTP)推测式解码器。
官方模型卡显示,这个模块可以在一次前向过程中预测后续 7 个 Token,再进行并行验证。
其基本思想是:
普通生成:
Token 1 → Token 2 → Token 3 → Token 4
MTP:
┌→ Token 2
Token 1├→ Token 3
├→ Token 4
└→ Token 5
↓
并行验证
这样可以减少纯自回归生成中“一次只能向前走一个 Token”的限制。
需要注意,官方并没有在 MiMo-V2.6-Flash 产品页给出一个统一的“快 X 倍”数字,因此不应把上一代 MiMo-V2-Flash 的速度宣传直接套用到 V2.6-Flash 上。上一代 mimo-v2-flash 确实曾通过 3 层 MTP 宣传 2.5~3.7 倍推理加速,但它是不同版本的模型。
Agent:它真正想解决的是“完成工作”
MiMo-V2.6-Flash 的能力覆盖面非常广。
官方训练和评测涉及:
代码 Agent、通用 Agent、视觉 Agent、网络安全等任务。
例如在软件工程任务中,模型可以:
读取代码
↓
理解需求
↓
定位 Bug
↓
修改代码
↓
运行测试
↓
分析错误
↓
再次修改
在电脑操作和视觉 Agent 场景中,则可以理解屏幕内容、结合任务要求进行操作。
因此,Flash 更适合被嵌入到:
Coding Agent、办公 Agent、自动化系统、AI 助手、批量内容处理和多 Agent 系统
中,而不是只作为一个聊天机器人。
官方评测:Flash 的重点是“接近 Pro,但更高效”
小米公开的模型卡给出了 MiMo-V2.6-Flash 在多个 Agent 基准上的测试结果。
其中包括:
| Benchmark | MiMo-V2.6-Flash |
|---|---|
| DeepSWE v1.1 | 67.9 |
| ProgramBench | 26.0 |
| MiMo Code Bench | 61.2 |
| AutomationBench v1.0.6 | 52.3 |
| Toolathlon-Verified | 73.6 |
| Agents' Last Exam | 27.6 |
| Terminal Bench 4.0 | 28.8 |
| Terminal Bench 2.1 | 87.6 |
| OSWorld-Verified | 80.8 |
| JobBench | 61.2 |
| CyberGym | 95.1 |
| MiMo Cyber Bench | 77.2 |
| MiMo VisualCoding | 71.5 |
以上数据来自小米官方模型卡,是厂商公开的测试结果;不同 benchmark 的任务、工具环境和评分方式各不相同,因此不能将这些数字简单合成为一个统一的“综合能力分数”。
从测试覆盖面来看,它尤其强调的是:
代码执行、工具使用、电脑操作、视觉 Agent 与网络安全任务。
MiMo-V2.6-Flash 到底适合什么?
从整个产品设计来看,它最适合的并不是“偶尔问几个简单问题”,而是频繁发生、需要一定推理能力、同时又对成本敏感的任务。
例如:
AI 办公
阅读大量文档、分析表格、整理信息、生成报告。
Coding Agent
阅读代码库、执行任务、调试程序、运行测试。
自动化 Agent
浏览网页、调用工具、执行多步骤工作流。
多模态分析
同时处理图片、视频、音频和文字。
企业级批量任务
数据处理、分类、抽取、审核、批量生成。
多 Agent 系统
作为其中一个高频调用的基础模型,承担大量重复或中等复杂度任务。
这些场景共同指向一个关键词:
效率。
写在最后
如果把 MiMo-V2.6-Pro 看作 MiMo-V2.6 系列中追求旗舰能力的模型,那么 MiMo-V2.6-Flash 更像是“把先进模型能力真正大规模投入生产”的那一款。
它拥有:
1M Token 长上下文
原生文本 + 图像 + 视频 + 音频理解
深度思考
工具调用与 Agent 能力
309B 总参数 / 15B 激活参数的 Sparse MoE
Hybrid Attention
5 层 MTP 推测式解码
以及围绕真实 Agent 任务进行的大规模强化学习训练。
但它最重要的产品定位,其实可以浓缩成一句话:
不是让每一次 AI 调用都变得更“重”,而是在尽可能低的成本下,让 AI 能够持续完成足够复杂的工作。
这也是为什么小米将 MiMo-V2.6-Flash 定义为**“高效推理模型”**,并将它重点面向专业办公、高频调用、规模化任务以及多 Agent 协同场景。
从这个角度看,MiMo-V2.6-Flash 的价值并不只是“一个更便宜的 Pro”,而是 MiMo 对高性能 Agent 如何走向规模化应用的一种产品化回答。
API 接口地址:
-
Chat Completions API:
https://wcode.net/api/gpt/v1/chat/completions
-
Anthropic API:
https://wcode.net/api/anthropic/v1/messages
此 API 接口兼容 OpenAI 的 API 接口规范,可直接使用 OpenAI 的 SDK 来调用各个模型。仅需替换以下配置即可:
base_url替换为https://wcode.net/api/gpt/v1api_key替换为从 https://platform.wcode.net 获取到的 API Key具体可参考下方的各编程语言代码示例中的 OpenAI SDK 调用示例。
此模型支持 Anthropic / Claude 的 API 接口规范,可直接使用 Anthropic 的 SDK 来调用此模型。仅需替换以下配置即可:
ANTHROPIC_BASE_URL替换为https://wcode.net/api/anthropicANTHROPIC_API_KEY(或ANTHROPIC_AUTH_TOKEN)替换为从 https://platform.wcode.net 获取到的 API KeyANTHROPIC_MODEL(或model)替换为xiaomi/mimo-v2.6-flash
请求方法:
POST
各编程语言代码示例:
# TODO: 以下代码中的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
curl --request POST 'https://wcode.net/api/gpt/v1/chat/completions' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer API_KEY' \
--data '{
"model": "xiaomi/mimo-v2.6-flash",
"messages": [
{
"role": "user",
"content": "你好"
}
]
}'
import Foundation
let headers = [
"Authorization": "Bearer API_KEY", // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
"content-type": "application/json"
]
let parameters = [
"model": "xiaomi/mimo-v2.6-flash",
"messages": [
[
"role": "user",
"content": "你好"
]
]
] as [String : Any]
let postData = JSONSerialization.data(withJSONObject: parameters, options: [])
let request = NSMutableURLRequest(url: NSURL(string: "https://wcode.net/api/gpt/v1/chat/completions")! as URL,
cachePolicy: .useProtocolCachePolicy,
timeoutInterval: 60.0)
request.httpMethod = "POST"
request.allHTTPHeaderFields = headers
request.httpBody = postData as Data
let session = URLSession.shared
let dataTask = session.dataTask(with: request as URLRequest, completionHandler: { (data, response, error) -> Void in
if (error != nil) {
print(error as Any)
} else {
let httpResponse = response as? HTTPURLResponse
print(httpResponse)
}
})
dataTask.resume()
var headers = {
'Content-Type': 'application/json',
'Authorization': 'Bearer API_KEY' // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
};
var request = http.Request('POST', Uri.parse('https://wcode.net/api/gpt/v1/chat/completions'));
request.body = json.encode({
"model": "xiaomi/mimo-v2.6-flash",
"messages": [
{
"role": "user",
"content": "你好"
}
]
});
request.headers.addAll(headers);
http.StreamedResponse response = await request.send();
if (response.statusCode == 200) {
print(await response.stream.bytesToString());
}
else {
print(response.reasonPhrase);
}
require 'uri'
require 'net/http'
url = URI("https://wcode.net/api/gpt/v1/chat/completions")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Post.new(url)
request["Authorization"] = 'Bearer API_KEY' # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
request["content-type"] = 'application/json'
request.body = "{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}"
response = http.request(request)
puts response.read_body
use serde_json::json;
use reqwest;
#[tokio::main]
pub async fn main() {
let url = "https://wcode.net/api/gpt/v1/chat/completions";
let payload = json!({
"model": "xiaomi/mimo-v2.6-flash",
"messages": (
json!({
"role": "user",
"content": "你好"
})
)
});
let mut headers = reqwest::header::HeaderMap::new();
headers.insert("Authorization", "Bearer API_KEY".parse().unwrap()); // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
headers.insert("content-type", "application/json".parse().unwrap());
let client = reqwest::Client::new();
let response = client.post(url)
.headers(headers)
.json(&payload)
.send()
.await;
let results = response.unwrap()
.json::<serde_json::Value>()
.await
.unwrap();
dbg!(results);
}
CURL *hnd = curl_easy_init();
curl_easy_setopt(hnd, CURLOPT_CUSTOMREQUEST, "POST");
curl_easy_setopt(hnd, CURLOPT_URL, "https://wcode.net/api/gpt/v1/chat/completions");
struct curl_slist *headers = NULL;
headers = curl_slist_append(headers, "Authorization: Bearer API_KEY"); // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
headers = curl_slist_append(headers, "content-type: application/json");
curl_easy_setopt(hnd, CURLOPT_HTTPHEADER, headers);
curl_easy_setopt(hnd, CURLOPT_POSTFIELDS, "{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}");
CURLcode ret = curl_easy_perform(hnd);
package main
import (
"fmt"
"strings"
"net/http"
"io"
)
func main() {
url := "https://wcode.net/api/gpt/v1/chat/completions"
payload := strings.NewReader("{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}")
req, _ := http.NewRequest("POST", url, payload)
req.Header.Add("Authorization", "Bearer API_KEY") // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
req.Header.Add("content-type", "application/json")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(res)
fmt.Println(string(body))
}
using System.Net.Http.Headers;
var client = new HttpClient();
var request = new HttpRequestMessage(HttpMethod.Post, "https://wcode.net/api/gpt/v1/chat/completions");
request.Headers.Add("Authorization", "Bearer API_KEY"); // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
request.Content = new StringContent("{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}", null, "application/json");
var response = await client.SendAsync(request);
response.EnsureSuccessStatusCode();
Console.WriteLine(await response.Content.ReadAsStringAsync());
var client = new RestClient("https://wcode.net/api/gpt/v1/chat/completions");
var request = new RestRequest("", Method.Post);
request.AddHeader("Authorization", "Bearer API_KEY"); // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
request.AddHeader("content-type", "application/json");
request.AddParameter("application/json", "{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}", ParameterType.RequestBody);
var response = client.Execute(request);
const axios = require('axios');
let data = JSON.stringify({
"model": "xiaomi/mimo-v2.6-flash",
"messages": [
{
"role": "user",
"content": "你好"
}
]
});
let config = {
method: 'post',
maxBodyLength: Infinity,
url: 'https://wcode.net/api/gpt/v1/chat/completions',
headers: {
'Content-Type': 'application/json',
'Authorization': 'Bearer API_KEY' // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
},
data : data
};
axios.request(config).then((response) => {
console.log(JSON.stringify(response.data));
}).catch((error) => {
console.log(error);
});
OkHttpClient client = new OkHttpClient();
MediaType mediaType = MediaType.parse("application/json");
RequestBody body = RequestBody.create(mediaType, "{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}");
Request request = new Request.Builder()
.url("https://wcode.net/api/gpt/v1/chat/completions")
.post(body)
.addHeader("Authorization", "Bearer API_KEY") // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
.addHeader("content-type", "application/json")
.build();
Response response = client.newCall(request).execute();
$client = new \GuzzleHttp\Client();
$headers = [
'Content-Type' => 'application/json',
'Authorization' => 'Bearer API_KEY', // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
];
$body = '{
"model": "xiaomi/mimo-v2.6-flash",
"messages": [
{
"role": "user",
"content": "你好"
}
]
}';
$request = new \GuzzleHttp\Psr7\Request('POST', 'https://wcode.net/api/gpt/v1/chat/completions', $headers, $body);
$response = $client->sendAsync($request)->wait();
echo $response->getBody();
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://wcode.net/api/gpt/v1/chat/completions",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 5,
CURLOPT_TIMEOUT => 300,
CURLOPT_CUSTOMREQUEST => "POST",
CURLOPT_POSTFIELDS => json_encode([
'model' => 'xiaomi/mimo-v2.6-flash',
'messages' => [
[
'role' => 'user',
'content' => '你好'
]
]
]),
CURLOPT_HTTPHEADER => [
"Authorization: Bearer API_KEY", // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
"content-type: application/json",
],
]);
$response = curl_exec($curl);
$error = curl_error($curl);
curl_close($curl);
if ($error) {
echo "cURL Error #:" . $error;
} else {
echo $response;
}
import requests
import json
url = "https://wcode.net/api/gpt/v1/chat/completions"
payload = {
"model": "xiaomi/mimo-v2.6-flash",
"messages": [
{
"role": "user",
"content": "你好"
}
]
}
headers = {
"Authorization": "Bearer API_KEY", # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
"content-type": "application/json"
}
response = requests.post(url, json=payload, headers=headers)
print(json.dumps(response.json(), indent=4, ensure_ascii=False))
from openai import OpenAI
client = OpenAI(
base_url="https://wcode.net/api/gpt/v1",
api_key="API_KEY" # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
)
completion = client.chat.completions.create(
model="xiaomi/mimo-v2.6-flash",
messages=[
{
"role": "user",
"content": "你好"
}
]
)
print(completion.choices[0].message.content)
各 AI 产品/工具/第三方应用接入示例:
配置 Hermes Agent 使用 Xiaomi MiMo-V2.6-Flash 模型:
注意事项:以下配置中的
<API_KEY>需要替换为从 https://platform.wcode.net 获取(创建)的 API Key
方式一:交互式配置
在命令行输入 hermes model,然后选择 Custom endpoint 选项,根据交互式命令引导,分别配置以下信息:
- API base URL:
https://wcode.net/api/gpt/v1 - API Key:
<API_KEY> - Model:
xiaomi/mimo-v2.6-flash
方式二:手动配置
修改 config.yaml(通常位于~/.hermes/config.yaml)
model:
default: "xiaomi/mimo-v2.6-flash"
provider: custom
base_url: "https://wcode.net/api/gpt/v1"
api_key: "<API_KEY>"
context_length: 1024000
配置完成后,就可以开始使用 Hermes Agent ~
配置 Roo Code 使用 Xiaomi MiMo-V2.6-Flash 模型:
注意事项:以下配置中的
<API_KEY>需要替换为从 https://platform.wcode.net 获取(创建)的 API Key
- API Provider:
OpenAI Compatible - Base URL:
https://wcode.net/api/gpt/v1 - API Key:
<API_KEY> - Model:
xiaomi/mimo-v2.6-flash
配置完成后,就可以开始使用 Roo Code ~
配置 Kilo Code 使用 Xiaomi MiMo-V2.6-Flash 模型:
注意事项:以下配置中的
<API_KEY>需要替换为从 https://platform.wcode.net 获取(创建)的 API Key
选择 Use your own API key,然后配置以下信息:
- API Provider:
OpenAI Compatible - Base URL:
https://wcode.net/api/gpt/v1 - API Key:
<API_KEY> - Model:
xiaomi/mimo-v2.6-flash
配置完成后,就可以开始使用 Kilo Code ~
配置 Cline 使用 Xiaomi MiMo-V2.6-Flash 模型:
注意事项:以下配置中的
<API_KEY>需要替换为从 https://platform.wcode.net 获取(创建)的 API Key
- API Provider:
OpenAI Compatible - Base URL:
https://wcode.net/api/gpt/v1 - API Key:
<API_KEY> - Model ID:
xiaomi/mimo-v2.6-flash
配置完成后,就可以开始使用 Cline ~
注:以下安装和配置过程以 Ubuntu Server 24.04 (root 用户) + Node 22 安装 OpenClaw 🦞 2026.3.8 为例
安装 🦞 OpenClaw(龙虾),步骤如下:
- 命令行执行
npm install -g openclaw@latest - 命令行执行
openclaw onboard --install-daemon - I understand this is personal-by-default and shared/multi-user use requires lock-down. Continue? 选择
yes - Onboarding mode 选择
QuickStart - Model/auth provider 选择
Skip for now - Default model 选择
Keep current (default: ...) - Select channel (QuickStart) 选择
Skip for now - Web search 选择
Skip for now - Configure skills now? (recommended) 选择
No - Enable hooks? (这是一个多选,按空格键可选中选项)按空格键选中
📝 command-logger和💾 session-memory这两个选项,然后按回车键进入下一步 - (如有) How do you want to hatch your bot? 选择
Hatch in TUI (recommended)
配置 🦞 OpenClaw(龙虾)使用 Xiaomi MiMo-V2.6-Flash 模型:
注意事项:以下配置中的
<API_KEY>需要替换为从 https://platform.wcode.net 获取(创建)的 API Key
推荐方式:修改 openclaw.json(通常位于~/.openclaw/openclaw.json)
找到openclaw.json的第一层级的models和agents属性(如果没有则在第一层级添加models和agents属性),改为如下配置:
{
...其他配置,
"models": {
"mode": "merge",
"providers": {
"wcode": {
"baseUrl": "https://wcode.net/api/gpt/v1",
"apiKey": "<API_KEY>",
"api": "openai-completions",
"models": [
{
"id": "xiaomi/mimo-v2.6-flash",
"name": "Xiaomi MiMo-V2.6-Flash",
"reasoning": false,
"input": ["text"],
"contextWindow": 1024000,
"maxTokens": 128000
}
]
}
}
},
"agents": {
"defaults": {
"model": {
"primary": "wcode/xiaomi/mimo-v2.6-flash"
}
}
},
...其他配置
}
完成以上配置后,
- 执行以下命令,即可通过命令行的方式开始对话:
openclaw tui
- 执行以下命令,即可通过 Web 界面的方式开始对话:
openclaw dashboard
配置 OpenCode 使用 Xiaomi MiMo-V2.6-Flash 模型:
推荐方式:修改 opencode.json(通常位于~/.config/opencode/opencode.json)
注意事项:以下配置中的
<API_KEY>需要替换为从 https://platform.wcode.net 获取的 API Key
配置如下:
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"myprovider": {
"npm": "@ai-sdk/openai-compatible",
"name": "wcode",
"options": {
"baseURL": "https://wcode.net/api/gpt/v1",
"apiKey": "<API_KEY>"
},
"models": {
"xiaomi/mimo-v2.6-flash": {
"name": "Xiaomi MiMo-V2.6-Flash"
}
}
}
}
}
完成以上配置后,执行以下命令,即可启动 OpenCode:
opencode
输入 /models,选择配置的 xiaomi/mimo-v2.6-flash 模型并在 OpenCode 中使用。
API 响应示例(curl):
{
"id": "chatcmpl-t1790087349s529rd5aaefc92d3226c777a1cce7",
"choices": [
{
"finish_reason": "stop",
"index": 0,
"message": {
"content": "你好!我是MiMo-V2.6-Flash,由小米大模型Core团队开发。我可以帮你解答问题、提供信息、陪你聊天,随时准备为你服务哦~",
"role": "assistant",
"tool_calls": null,
"reasoning_content": "好的,用户的问题是直接要求我介绍自己,这可能是在测试我的身份或寻求基本信息。深层需求是确认我是小米自研的AI助手,而不是其他模型。根据首要原则,我需要友善、积极地回应,突出自己的核心角色和功能,避免任何真实身份混淆。简要分析:关键点包括我的名字、作为小米MiMo的身份、开发团队、能力如解答和陪伴,以及保持轻快亲切的风格。拟定回答结构:先热情打招呼,然后自我介绍主体,最后表达服务意愿。"
}
}
],
"created": 1790087354,
"model": "mimo-v2.6-flash",
"object": "chat.completion",
"usage": {
"completion_tokens": 153,
"prompt_tokens": 23,
"total_tokens": 176,
"completion_tokens_details": {
"reasoning_tokens": 114
},
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}
请求参数:
- messages(对话消息)
- model(模型 ID)
- top_k(Top-K)
- top_a(Top-A)
- max_tokens(最大 tokens 数)
- logprobs(对数概率)
- tools(工具)
- verbosity(冗长程度)
- logit_bias(Logit Bias)
- stream(流式输出)
- repetition_penalty(重复惩罚)
- seed(种子)
- min_p(Min-P)
- parallel_tool_calls(并行工具调用)
- frequency_penalty(频率惩罚)
- top_p(Top-P)
- tool_choice(工具选择)
- stop(停止)
- structured_outputs(结构化输出)
- temperature(温度)
- top_logprobs(最高对数概率)
- response_format(响应格式)
- presence_penalty(存在惩罚)
重要提示:由于模型架构不同,部分参数可能仅适用于特定的模型。
messages(对话消息)
-
参数:
messages -
必选,object
对话消息列表,包含当前对话的完整上下文信息。每条消息都有特定的角色和内容,模型会根据这些消息生成回复。消息按时间顺序排列,支持三种角色:system(系统消息,用于设定 AI 的行为和角色)、user(用户消息,来自用户的输入)、assistant(助手消息,来自 AI 的回复)。普通对话模型主要支持纯文本内容。
messages 格式请参考代码示例。注意:不能只包含系统消息或助手消息。
model(模型 ID)
-
参数:
model -
必选,string
调用时使用的模型 ID。请使用模型详情页展示的模型 ID。
top_k(Top-K)
-
参数:
top_k -
可选,int,>= 0
-
默认:
0
top_k 会限制模型在每一步对 token 的选择,使其从较小的集合中进行选择。值为 1 表示模型将始终选择最有可能的下一个 token,从而得到可预测的结果。
top_a(Top-A)
-
参数:
top_a -
可选,float,0.0 到 1.0
-
默认:
0.0
top_a 仅考虑概率“足够高”的 top tokens,该概率基于最可能的 token 概率。可以将其视为一个动态的 Top-P。较低的 Top-A 值会根据概率最高的 token 集中选择,但范围会更窄。较高的 Top-A 值不一定会影响输出的创造性,但会根据最大概率优化过滤过程。
max_tokens(最大 tokens 数)
-
参数:
max_tokens -
可选,int,>= 1
max_tokens 可设定模型在响应中可以生成的 token 数量的上限。模型不会生成超过此限制的 token。其最大值等于上下文长度减去 prompt 长度。
logprobs(对数概率)
-
参数:
logprobs -
可选,boolean
logprobs 设置是否返回输出 token 的对数概率。如果为 true,则返回每个输出 token 的对数概率。
tools(工具)
-
参数:
tools -
可选,array
工具调用参数,遵循 OpenAI 的工具调用请求格式。对于非 OpenAI 提供者,会相应地进行转换。
verbosity(冗长程度)
-
参数:
verbosity -
可选,string
-
取值范围:
low|medium|high -
默认:
medium
控制模型响应的冗长程度和长度。较低的值会生成更简洁的回答,而较高的值会生成更详细、更全面的回答。
logit_bias(Logit Bias)
-
参数:
logit_bias -
可选,object
logit_bias 是一个可选参数,用于修改指定 token 在模型生成输出中出现的可能性。
stream(流式输出)
-
参数:
stream -
可选,boolean
-
取值范围:
true|false -
默认:
false
是否开启流式输出。设为 true 时,模型以 SSE 形式逐块返回生成内容;设为 false 时,等待完整响应后一次性返回。
repetition_penalty(重复惩罚)
-
参数:
repetition_penalty -
可选,float,0.0 至 2.0
-
默认:
1.0
repetition_penalty 有助于减少输入中标记的重复。较高的值会降低模型重复标记的可能性,但过高的值会使输出不够连贯(通常会出现缺少小词的连续句子)。标记惩罚会根据原始标记的概率进行调整。
seed(种子)
-
参数:
seed -
可选,int
如果指定了 seed 参数,推理将确定性地进行采样,即使用相同种子和参数的重复请求应该返回相同的结果。某些模型无法保证确定性。
min_p(Min-P)
-
参数:
min_p -
可选,float,0.0 至 1.0
-
默认:
0.0
min_p 表示某个 token 被考虑的最小概率,该概率是相对于最可能的 token 的概率而言的。如果 min_p 设置为 0.1,则意味着它只允许概率至少为最佳选项十分之一的 token 被考虑。
parallel_tool_calls(并行工具调用)
-
参数:
parallel_tool_calls -
可选,boolean
-
默认:
true
是否在使用工具时启用并行函数调用。如果为 true,模型可以同时调用多个函数。如果为 false,函数将按顺序依次调用。
frequency_penalty(频率惩罚)
-
参数:
frequency_penalty -
可选,float,-2.0 至 2.0
-
默认:
0.0
frequency_penalty 可根据词条在输入中出现的频率来控制其重复使用。它会尝试减少那些在输入中出现频率较高的词条的使用频率,这与它们出现的频率成正比。词条惩罚会随着出现次数的增加而增加。负值将鼓励词条重复使用。
top_p(Top-P)
-
参数:
top_p -
可选,float,0.0 至 1.0
-
默认:
1.0
top_p 参数控制模型在生成文本时的候选词选择范围。具体来说,模型会生成一组候选 token,然后从累积概率达到或超过 p 的 token 中随机选择一个作为输出。通过这种方式,top_p 能够在保证生成内容的多样性的同时,考虑到概率分布的合理性。
由于 temperature 与 top_p 均可以控制生成文本的多样性,因此建议您只设置其中一个值。
tool_choice(工具选择)
-
参数:
tool_choice -
可选,string | object
-
默认:
auto
工具调用策略。
"none":禁止模型调用工具。"auto":自动判断是否调用(默认)。"required":强制模型必须调用一个或多个工具。{"type": "function", "function": {"name": "my_function"}}:指定特定工具会强制模型调用该工具。
stop(停止)
-
参数:
stop -
可选,array
如果模型遇到 stop 数组中指定的任意 token,则立即停止生成。
structured_outputs(结构化输出)
-
参数:
structured_outputs -
可选,boolean
指示模型是否能够使用 response_format 中的 json_schema 返回结构化输出。
temperature(温度)
-
参数:
temperature -
可选,float,0.0 到 2.0
-
默认:
1.0
此设置影响模型回复的多样性。较低的值会使回复更可预测、更常见;较高的值会鼓励更具多样性且较不常见的回复。当设置为 0 时,模型对相同输入将尽可能的给出相同的回复。
top_logprobs(最高对数概率)
-
参数:
top_logprobs -
可选,int,0 至 20
top_logprobs 是一个介于 0 和 20 之间的整数,指定在每个 token 位置要返回的最可能 token 的数量,每个 token 都会带有相应的对数概率。如果使用此参数,则必须将 logprobs 设置为 true。
response_format(响应格式)
-
参数:
response_format -
可选,object
response_format 强制模型产出特定的输出格式。将其设置为 { "type": "json_object" } 可启用 JSON 模式,保证模型生成的消息为有效的 JSON。
注意:使用 JSON 模式时,应同时通过 system 或 user 提示词指示模型生成 JSON。
presence_penalty(存在惩罚)
-
参数:
presence_penalty -
可选,float,-2.0 至 2.0
-
默认:
0.0
presence_penalty 调整模型重复输入中已使用的特定标记的频率。值越高,重复的可能性就越小,负值则相反。标记惩罚不会随着出现次数而变化。负值会鼓励标记重用。
以上文档为标准版 API 接口文档,可直接用于项目开发和系统调用。如果标准版 API 接口无法满足您的需求,需要定制开发 API 接口,请联系我们的 IT 技术支持工程师:
(沟通需求✅ → 确认技术方案✅ → 沟通费用与工期✅ → 开发&测试✅ → 验收交付✅ → 维护升级✅)
![]()