Xiaomi MiMo-V2.6-Flash API 接口、参数 & 代码示例

xiaomi/mimo-v2.6-flash

MiMo-V2.6-Flash 是小米发布新一代面向高频调用和规模化任务打造的高效推理模型。与定位旗舰性能的 V2.6-Pro 不同,Flash 更强调**能力、效率与成本之间的平衡**。MiMo-V2.6-Flash 保留了 MiMo-V2.6 的核心能力体系,包括原生全模态理解、深度思考、工具调用、超长上下文和 Agent 能力,同时通过更轻量的模型结构与训练策略,降低大规模实际使用时的推理成本。

模型 ID
xiaomi/mimo-v2.6-flash
模型系列
MiMo
更新日期
模型能力
文本生成、深度思考
上下文长度
1024 K
模型价格(每 1000 tokens 输入)
¥ 0.001
模型价格(每 1000 tokens 输出)
¥ 0.002

Xiaomi MiMo-V2.6-Flash 模型介绍:

MiMo-V2.6-Flash 是小米发布新一代面向高频调用和规模化任务打造的高效推理模型。与定位旗舰性能的 V2.6-Pro 不同,Flash 更强调能力、效率与成本之间的平衡。MiMo-V2.6-Flash 保留了 MiMo-V2.6 的核心能力体系,包括原生全模态理解、深度思考、工具调用、超长上下文和 Agent 能力,同时通过更轻量的模型结构与训练策略,降低大规模实际使用时的推理成本。

MiMo-V2.6-Flash 的定位为:

“全模态、高智能、低成本的高效推理模型,面向专业办公中的高频调用与规模化任务的最佳均衡之选。”


不只是更轻量,而是重新定义“高效”

很多模型的 Flash 版本,核心思路是牺牲一部分能力换取更低的成本。

MiMo-V2.6-Flash 的设计目标则更加明确:在真实工作流中保持较强的任务完成能力,同时减少完成任务所需要的 Token 和计算开销。

小米将这种定位概括为 Pareto 前沿——官方称,Flash 在真实工作流中的体验可以比肩主流 Pro 级模型,同时具有更好的 Token 效率。这里属于小米对产品表现的官方定位,并非一个独立机构给出的统一行业排名。

因此,它更适合这样的使用方式:

大量用户请求
      ↓
长上下文处理
      ↓
模型推理
      ↓
工具调用
      ↓
完成任务

重点不是让每一次调用都使用最高规格的计算资源,而是让模型能够以更低的单位成本持续完成大量任务。


原生全模态:文本、图片、视频、音频统一理解

MiMo-V2.6-Flash 最核心的能力之一,是原生全模态理解

模型支持:

文本、图像、视频、音频输入

最终输出则为文本

这意味着它不是一个单纯的文本模型再外挂一个视觉模块,而是将不同模态的信息纳入统一的模型体系。

例如,用户可以同时提供:

一份文字需求 + 一张设计稿 + 一段产品演示视频

让模型分析其中的问题、提取关键信息,再输出修改建议、代码或者执行计划。

同样,它也可以处理视频内容、音频内容与文本指令结合的任务,从而适用于更复杂的多模态 Agent 工作流。

官方技术报告显示,MiMo-V2.6-Flash-RL 配备 681M 参数的 MiMo ViT 视觉编码器,以及由 308M 参数 AudioTokenizer 和 127M 参数音频 Patch Encoder组成的音频编码部分。


1M Token 超长上下文

MiMo-V2.6-Flash 支持 1M Token 上下文窗口,最大输出长度为 128K Token

这使它能够处理远超普通对话长度的任务。

例如:

大型代码仓库

项目源码
+
依赖文件
+
测试代码
+
Git 历史
+
需求文档

可以放在同一个长上下文中,由模型持续分析。

又或者在 Agent 场景里:

用户任务
↓
工具调用
↓
网页内容
↓
中间结果
↓
错误日志
↓
再次调用工具
↓
最终结果

整个过程都可以持续保存在一个长上下文中。

小米明确将 1M Context 的使用场景指向大型代码仓库、Tool Trace、多 Session Agent 运行,以及多模态混合输入。


深度思考与 Agent 能力

MiMo-V2.6-Flash 并不是只追求快速回答,而是支持深度思考

官方 API 默认开启 Thinking,可以按照任务复杂程度进行推理;也可以通过 API 参数关闭。深度思考主要用于复杂推理、代码生成、数学计算以及多步骤分析等任务。

与此同时,模型原生支持:

工具调用、联网搜索、结构化输出、流式输出和上下文缓存。

这意味着它可以从:

“回答一个问题”

进一步走向:

“理解任务 → 规划步骤 → 使用工具 → 获取结果 → 继续推理 → 完成任务”。

这也是 MiMo-V2.6-Flash 与传统聊天模型最大的产品形态差异之一。


真正的核心升级:强化学习规模化

MiMo-V2.6 系列此次发布的重点,并不只是模型架构本身,而是强化学习规模的进一步扩大

小米把这次 MiMo-V2.6 的训练路线概括为:

Scaling Reinforcement Learning Toward Self-Improvement

即通过扩大 RL 算力、任务环境和评测/奖励计算,让模型在真实任务环境中不断探索、试错和获得反馈。

对于 Flash,官方技术报告特别强调了一个思路: You Only RL Once

它并不是针对代码、通用 Agent、视觉 Agent 和网络安全分别进行完全独立的 RL,而是将多个领域的任务混合在同一次 RL 流程中训练。

不同任务、不同 Harness 被放到同一个训练环境里,让一个领域中学到的策略能够向其他领域迁移。官方还希望这种训练方式能够提升模型在训练时没有见过的 Harness上的泛化能力。


让模型自己比较“哪些完成方式更好”

MiMo-V2.6-Flash-RL 的训练还有一个比较有特色的设计。

传统强化学习通常容易变成:

完成任务 → 成功
没有完成 → 失败

但对于 Agent 任务而言,两个方案都“成功”,并不代表它们质量相同。

比如:

方案 A:20 步完成,消耗 100K tokens
方案 B:8 步完成,消耗 30K tokens

如果只看最终是否成功,两者都可能得到同样的奖励。

因此,MiMo-V2.6 引入了 Groupwise Agentic Grading。模型会把同一个任务产生的多个结果放在一起比较,由 Agentic Grader 建立任务级评价标准,并进一步对“成功但质量更高”的轨迹进行区分。

官方称,这套机制旨在推动模型走向更短的任务路径和更低的 Token 消耗

这与 Flash 的产品定位高度一致:

不仅完成任务,还希望用更少的资源完成任务。


309B 参数,但只激活 15B

从模型规模来看,MiMo-V2.6-Flash 采用 Sparse MoE(稀疏专家混合)架构

指标 MiMo-V2.6-Flash-RL
总参数量 309B
激活参数量 15B
架构 Sparse MoE
最大上下文 1M tokens
最大输出 128K tokens
输入 文本 / 图像 / 视频 / 音频
输出 文本

也就是说,模型拥有 309B 总参数,但单次计算只激活其中约 15B 参数

这正是 MoE 架构的价值之一:

模型总容量可以做得很大,但每次推理不需要让所有专家同时参与。

因此,Flash 可以在拥有较大模型容量的同时,尽量控制单次推理所需要的计算资源。


Hybrid Attention:专门针对长上下文做效率优化

MiMo-V2.6-Flash 的语言模型 Backbone 一共有 48 层

  • 39 层 Sliding Window Attention(SWA)
  • 9 层 Global Attention(GA)

SWA 窗口大小为 128

模型共有 256 个 Routed Experts,每次激活 8 个专家

简单来说,大多数层主要关注当前位置附近的信息,同时用少数 Global Attention 层承担更远距离的信息交互。

对于 1M Token 这种规模的上下文而言,这种设计可以避免每一层都以最高成本处理全部上下文,从架构层面兼顾长上下文能力与推理效率


MTP:进一步提高生成效率

MiMo-V2.6-Flash 还使用了 5 层 Multi-Token Prediction(MTP)推测式解码器

官方模型卡显示,这个模块可以在一次前向过程中预测后续 7 个 Token,再进行并行验证。

其基本思想是:

普通生成:

Token 1 → Token 2 → Token 3 → Token 4


MTP:

       ┌→ Token 2
Token 1├→ Token 3
       ├→ Token 4
       └→ Token 5

        ↓
      并行验证

这样可以减少纯自回归生成中“一次只能向前走一个 Token”的限制。

需要注意,官方并没有在 MiMo-V2.6-Flash 产品页给出一个统一的“快 X 倍”数字,因此不应把上一代 MiMo-V2-Flash 的速度宣传直接套用到 V2.6-Flash 上。上一代 mimo-v2-flash 确实曾通过 3 层 MTP 宣传 2.5~3.7 倍推理加速,但它是不同版本的模型。


Agent:它真正想解决的是“完成工作”

MiMo-V2.6-Flash 的能力覆盖面非常广。

官方训练和评测涉及:

代码 Agent、通用 Agent、视觉 Agent、网络安全等任务。

例如在软件工程任务中,模型可以:

读取代码
↓
理解需求
↓
定位 Bug
↓
修改代码
↓
运行测试
↓
分析错误
↓
再次修改

在电脑操作和视觉 Agent 场景中,则可以理解屏幕内容、结合任务要求进行操作。

因此,Flash 更适合被嵌入到:

Coding Agent、办公 Agent、自动化系统、AI 助手、批量内容处理和多 Agent 系统

中,而不是只作为一个聊天机器人。


官方评测:Flash 的重点是“接近 Pro,但更高效”

小米公开的模型卡给出了 MiMo-V2.6-Flash 在多个 Agent 基准上的测试结果。

其中包括:

Benchmark MiMo-V2.6-Flash
DeepSWE v1.1 67.9
ProgramBench 26.0
MiMo Code Bench 61.2
AutomationBench v1.0.6 52.3
Toolathlon-Verified 73.6
Agents' Last Exam 27.6
Terminal Bench 4.0 28.8
Terminal Bench 2.1 87.6
OSWorld-Verified 80.8
JobBench 61.2
CyberGym 95.1
MiMo Cyber Bench 77.2
MiMo VisualCoding 71.5

以上数据来自小米官方模型卡,是厂商公开的测试结果;不同 benchmark 的任务、工具环境和评分方式各不相同,因此不能将这些数字简单合成为一个统一的“综合能力分数”。

从测试覆盖面来看,它尤其强调的是:

代码执行、工具使用、电脑操作、视觉 Agent 与网络安全任务。


MiMo-V2.6-Flash 到底适合什么?

从整个产品设计来看,它最适合的并不是“偶尔问几个简单问题”,而是频繁发生、需要一定推理能力、同时又对成本敏感的任务

例如:

AI 办公

阅读大量文档、分析表格、整理信息、生成报告。

Coding Agent

阅读代码库、执行任务、调试程序、运行测试。

自动化 Agent

浏览网页、调用工具、执行多步骤工作流。

多模态分析

同时处理图片、视频、音频和文字。

企业级批量任务

数据处理、分类、抽取、审核、批量生成。

多 Agent 系统

作为其中一个高频调用的基础模型,承担大量重复或中等复杂度任务。

这些场景共同指向一个关键词:

效率。


写在最后

如果把 MiMo-V2.6-Pro 看作 MiMo-V2.6 系列中追求旗舰能力的模型,那么 MiMo-V2.6-Flash 更像是“把先进模型能力真正大规模投入生产”的那一款。

它拥有:

1M Token 长上下文

原生文本 + 图像 + 视频 + 音频理解

深度思考

工具调用与 Agent 能力

309B 总参数 / 15B 激活参数的 Sparse MoE

Hybrid Attention

5 层 MTP 推测式解码

以及围绕真实 Agent 任务进行的大规模强化学习训练。

但它最重要的产品定位,其实可以浓缩成一句话:

不是让每一次 AI 调用都变得更“重”,而是在尽可能低的成本下,让 AI 能够持续完成足够复杂的工作。

这也是为什么小米将 MiMo-V2.6-Flash 定义为**“高效推理模型”**,并将它重点面向专业办公、高频调用、规模化任务以及多 Agent 协同场景。

从这个角度看,MiMo-V2.6-Flash 的价值并不只是“一个更便宜的 Pro”,而是 MiMo 对高性能 Agent 如何走向规模化应用的一种产品化回答。

API 接口地址:

  • Chat Completions API:

    https://wcode.net/api/gpt/v1/chat/completions

  • Anthropic API:

    https://wcode.net/api/anthropic/v1/messages

此 API 接口兼容 OpenAI 的 API 接口规范,可直接使用 OpenAI 的 SDK 来调用各个模型。仅需替换以下配置即可:

  1. base_url 替换为 https://wcode.net/api/gpt/v1
  2. api_key 替换为从 https://platform.wcode.net 获取到的 API Key

具体可参考下方的各编程语言代码示例中的 OpenAI SDK 调用示例。

此模型支持 Anthropic / Claude 的 API 接口规范,可直接使用 Anthropic 的 SDK 来调用此模型。仅需替换以下配置即可:

  1. ANTHROPIC_BASE_URL 替换为 https://wcode.net/api/anthropic
  2. ANTHROPIC_API_KEY(或 ANTHROPIC_AUTH_TOKEN)替换为从 https://platform.wcode.net 获取到的 API Key
  3. ANTHROPIC_MODEL(或model)替换为 xiaomi/mimo-v2.6-flash

请求方法:

POST

各编程语言代码示例:

# TODO: 以下代码中的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
curl --request POST 'https://wcode.net/api/gpt/v1/chat/completions' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer API_KEY' \
--data '{
    "model": "xiaomi/mimo-v2.6-flash",
    "messages": [
        {
            "role": "user",
            "content": "你好"
        }
    ]
}'
import Foundation

let headers = [
  "Authorization": "Bearer API_KEY",  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  "content-type": "application/json"
]
let parameters = [
  "model": "xiaomi/mimo-v2.6-flash",
  "messages": [
    [
      "role": "user",
      "content": "你好"
    ]
  ]
] as [String : Any]

let postData = JSONSerialization.data(withJSONObject: parameters, options: [])

let request = NSMutableURLRequest(url: NSURL(string: "https://wcode.net/api/gpt/v1/chat/completions")! as URL,
                                        cachePolicy: .useProtocolCachePolicy,
                                    timeoutInterval: 60.0)
request.httpMethod = "POST"
request.allHTTPHeaderFields = headers
request.httpBody = postData as Data

let session = URLSession.shared
let dataTask = session.dataTask(with: request as URLRequest, completionHandler: { (data, response, error) -> Void in
  if (error != nil) {
    print(error as Any)
  } else {
    let httpResponse = response as? HTTPURLResponse
    print(httpResponse)
  }
})

dataTask.resume()
var headers = {
  'Content-Type': 'application/json',
  'Authorization': 'Bearer API_KEY'  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
};
var request = http.Request('POST', Uri.parse('https://wcode.net/api/gpt/v1/chat/completions'));
request.body = json.encode({
  "model": "xiaomi/mimo-v2.6-flash",
  "messages": [
    {
      "role": "user",
      "content": "你好"
    }
  ]
});
request.headers.addAll(headers);

http.StreamedResponse response = await request.send();

if (response.statusCode == 200) {
  print(await response.stream.bytesToString());
}
else {
  print(response.reasonPhrase);
}
require 'uri'
require 'net/http'

url = URI("https://wcode.net/api/gpt/v1/chat/completions")

http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true

request = Net::HTTP::Post.new(url)
request["Authorization"] = 'Bearer API_KEY'  # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
request["content-type"] = 'application/json'
request.body = "{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}"

response = http.request(request)
puts response.read_body
use serde_json::json;
use reqwest;

#[tokio::main]
pub async fn main() {
  let url = "https://wcode.net/api/gpt/v1/chat/completions";

  let payload = json!({
    "model": "xiaomi/mimo-v2.6-flash",
    "messages": (
      json!({
        "role": "user",
        "content": "你好"
      })
    )
  });

  let mut headers = reqwest::header::HeaderMap::new();
  headers.insert("Authorization", "Bearer API_KEY".parse().unwrap());  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  headers.insert("content-type", "application/json".parse().unwrap());

  let client = reqwest::Client::new();
  let response = client.post(url)
    .headers(headers)
    .json(&payload)
    .send()
    .await;

  let results = response.unwrap()
    .json::<serde_json::Value>()
    .await
    .unwrap();

  dbg!(results);
}
CURL *hnd = curl_easy_init();

curl_easy_setopt(hnd, CURLOPT_CUSTOMREQUEST, "POST");
curl_easy_setopt(hnd, CURLOPT_URL, "https://wcode.net/api/gpt/v1/chat/completions");

struct curl_slist *headers = NULL;
headers = curl_slist_append(headers, "Authorization: Bearer API_KEY");  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
headers = curl_slist_append(headers, "content-type: application/json");
curl_easy_setopt(hnd, CURLOPT_HTTPHEADER, headers);

curl_easy_setopt(hnd, CURLOPT_POSTFIELDS, "{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}");

CURLcode ret = curl_easy_perform(hnd);
package main

import (
  "fmt"
  "strings"
  "net/http"
  "io"
)

func main() {
  url := "https://wcode.net/api/gpt/v1/chat/completions"

  payload := strings.NewReader("{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}")

  req, _ := http.NewRequest("POST", url, payload)

  req.Header.Add("Authorization", "Bearer API_KEY")  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  req.Header.Add("content-type", "application/json")

  res, _ := http.DefaultClient.Do(req)

  defer res.Body.Close()
  body, _ := io.ReadAll(res.Body)

  fmt.Println(res)
  fmt.Println(string(body))
}
using System.Net.Http.Headers;


var client = new HttpClient();

var request = new HttpRequestMessage(HttpMethod.Post, "https://wcode.net/api/gpt/v1/chat/completions");

request.Headers.Add("Authorization", "Bearer API_KEY");  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net

request.Content = new StringContent("{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}", null, "application/json");

var response = await client.SendAsync(request);

response.EnsureSuccessStatusCode();

Console.WriteLine(await response.Content.ReadAsStringAsync());
var client = new RestClient("https://wcode.net/api/gpt/v1/chat/completions");

var request = new RestRequest("", Method.Post);

request.AddHeader("Authorization", "Bearer API_KEY");  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net

request.AddHeader("content-type", "application/json");

request.AddParameter("application/json", "{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}", ParameterType.RequestBody);

var response = client.Execute(request);
const axios = require('axios');

let data = JSON.stringify({
  "model": "xiaomi/mimo-v2.6-flash",
  "messages": [
    {
      "role": "user",
      "content": "你好"
    }
  ]
});

let config = {
  method: 'post',
  maxBodyLength: Infinity,
  url: 'https://wcode.net/api/gpt/v1/chat/completions',
  headers: {
    'Content-Type': 'application/json',
    'Authorization': 'Bearer API_KEY'  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  },
  data : data
};

axios.request(config).then((response) => {
  console.log(JSON.stringify(response.data));
}).catch((error) => {
  console.log(error);
});
OkHttpClient client = new OkHttpClient();

MediaType mediaType = MediaType.parse("application/json");

RequestBody body = RequestBody.create(mediaType, "{\"model\":\"xiaomi/mimo-v2.6-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}");

Request request = new Request.Builder()
  .url("https://wcode.net/api/gpt/v1/chat/completions")
  .post(body)
  .addHeader("Authorization", "Bearer API_KEY")  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  .addHeader("content-type", "application/json")
  .build();

Response response = client.newCall(request).execute();
$client = new \GuzzleHttp\Client();

$headers = [
  'Content-Type' => 'application/json',
  'Authorization' => 'Bearer API_KEY',  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
];

$body = '{
  "model": "xiaomi/mimo-v2.6-flash",
  "messages": [
    {
      "role": "user",
      "content": "你好"
    }
  ]
}';

$request = new \GuzzleHttp\Psr7\Request('POST', 'https://wcode.net/api/gpt/v1/chat/completions', $headers, $body);

$response = $client->sendAsync($request)->wait();

echo $response->getBody();
$curl = curl_init();

curl_setopt_array($curl, [
  CURLOPT_URL => "https://wcode.net/api/gpt/v1/chat/completions",
  CURLOPT_RETURNTRANSFER => true,
  CURLOPT_ENCODING => "",
  CURLOPT_MAXREDIRS => 5,
  CURLOPT_TIMEOUT => 300,
  CURLOPT_CUSTOMREQUEST => "POST",
  CURLOPT_POSTFIELDS => json_encode([
    'model' => 'xiaomi/mimo-v2.6-flash',
    'messages' => [
      [
        'role' => 'user',
        'content' => '你好'
      ]
    ]
  ]),
  CURLOPT_HTTPHEADER => [
    "Authorization: Bearer API_KEY",  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
    "content-type: application/json",
  ],
]);

$response = curl_exec($curl);
$error = curl_error($curl);

curl_close($curl);

if ($error) {
  echo "cURL Error #:" . $error;
} else {
  echo $response;
}
import requests
import json

url = "https://wcode.net/api/gpt/v1/chat/completions"

payload = {
  "model": "xiaomi/mimo-v2.6-flash",
  "messages": [
    {
      "role": "user",
      "content": "你好"
    }
  ]
}

headers = {
  "Authorization": "Bearer API_KEY",  # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  "content-type": "application/json"
}

response = requests.post(url, json=payload, headers=headers)

print(json.dumps(response.json(), indent=4, ensure_ascii=False))
from openai import OpenAI

client = OpenAI(
  base_url="https://wcode.net/api/gpt/v1",
  api_key="API_KEY"  # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
)

completion = client.chat.completions.create(
  model="xiaomi/mimo-v2.6-flash",
  messages=[
    {
      "role": "user",
      "content": "你好"
    }
  ]
)

print(completion.choices[0].message.content)

各 AI 产品/工具/第三方应用接入示例:

配置 Hermes Agent 使用 Xiaomi MiMo-V2.6-Flash 模型

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

方式一:交互式配置

在命令行输入 hermes model,然后选择 Custom endpoint 选项,根据交互式命令引导,分别配置以下信息:

  • API base URL:https://wcode.net/api/gpt/v1
  • API Key:<API_KEY>
  • Model:xiaomi/mimo-v2.6-flash

方式二:手动配置

修改 config.yaml(通常位于~/.hermes/config.yaml

model:
  default: "xiaomi/mimo-v2.6-flash"
  provider: custom
  base_url: "https://wcode.net/api/gpt/v1"
  api_key: "<API_KEY>"
  context_length: 1024000

配置完成后,就可以开始使用 Hermes Agent ~

配置 Roo Code 使用 Xiaomi MiMo-V2.6-Flash 模型

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

  • API Provider:OpenAI Compatible
  • Base URL:https://wcode.net/api/gpt/v1
  • API Key:<API_KEY>
  • Model:xiaomi/mimo-v2.6-flash

配置完成后,就可以开始使用 Roo Code ~

配置 Kilo Code 使用 Xiaomi MiMo-V2.6-Flash 模型

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

选择 Use your own API key,然后配置以下信息:

  • API Provider:OpenAI Compatible
  • Base URL:https://wcode.net/api/gpt/v1
  • API Key:<API_KEY>
  • Model:xiaomi/mimo-v2.6-flash

配置完成后,就可以开始使用 Kilo Code ~

配置 Cline 使用 Xiaomi MiMo-V2.6-Flash 模型

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

  • API Provider:OpenAI Compatible
  • Base URL:https://wcode.net/api/gpt/v1
  • API Key:<API_KEY>
  • Model ID:xiaomi/mimo-v2.6-flash

配置完成后,就可以开始使用 Cline ~

注:以下安装和配置过程以 Ubuntu Server 24.04 (root 用户) + Node 22 安装 OpenClaw 🦞 2026.3.8 为例

安装 🦞 OpenClaw(龙虾),步骤如下:

  1. 命令行执行 npm install -g openclaw@latest
  2. 命令行执行 openclaw onboard --install-daemon
  3. I understand this is personal-by-default and shared/multi-user use requires lock-down. Continue? 选择 yes
  4. Onboarding mode 选择 QuickStart
  5. Model/auth provider 选择 Skip for now
  6. Default model 选择 Keep current (default: ...)
  7. Select channel (QuickStart) 选择 Skip for now
  8. Web search 选择 Skip for now
  9. Configure skills now? (recommended) 选择 No
  10. Enable hooks? (这是一个多选,按空格键可选中选项)按空格键选中 📝 command-logger💾 session-memory 这两个选项,然后按回车键进入下一步
  11. (如有) How do you want to hatch your bot? 选择 Hatch in TUI (recommended)

配置 🦞 OpenClaw(龙虾)使用 Xiaomi MiMo-V2.6-Flash 模型:

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

推荐方式:修改 openclaw.json(通常位于~/.openclaw/openclaw.json

找到openclaw.json的第一层级的modelsagents属性(如果没有则在第一层级添加modelsagents属性),改为如下配置:

{
  ...其他配置,

  "models": {
      "mode": "merge",
      "providers": {
          "wcode": {
              "baseUrl": "https://wcode.net/api/gpt/v1",
              "apiKey": "<API_KEY>",
              "api": "openai-completions",
              "models": [
                  {
                      "id": "xiaomi/mimo-v2.6-flash",
                      "name": "Xiaomi MiMo-V2.6-Flash",
                      "reasoning": false,
                      "input": ["text"],
                      "contextWindow": 1024000,
                      "maxTokens": 128000
                  }
              ]
          }
      }
  },
  "agents": {
      "defaults": {
         "model": {
             "primary": "wcode/xiaomi/mimo-v2.6-flash"
         }
      }
  },

  ...其他配置
}

完成以上配置后,

  1. 执行以下命令,即可通过命令行的方式开始对话:
openclaw tui
  1. 执行以下命令,即可通过 Web 界面的方式开始对话:
openclaw dashboard

配置 OpenCode 使用 Xiaomi MiMo-V2.6-Flash 模型

推荐方式:修改 opencode.json(通常位于~/.config/opencode/opencode.json

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取的 API Key

配置如下:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "myprovider": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "wcode",
      "options": {
        "baseURL": "https://wcode.net/api/gpt/v1",
        "apiKey": "<API_KEY>"
      },
      "models": {
        "xiaomi/mimo-v2.6-flash": {
          "name": "Xiaomi MiMo-V2.6-Flash"
        }
      }
    }
  }
}

完成以上配置后,执行以下命令,即可启动 OpenCode:

opencode

输入 /models,选择配置的 xiaomi/mimo-v2.6-flash 模型并在 OpenCode 中使用。

API 响应示例(curl):

{
    "id": "chatcmpl-t1790087349s529rd5aaefc92d3226c777a1cce7",
    "choices": [
        {
            "finish_reason": "stop",
            "index": 0,
            "message": {
                "content": "你好!我是MiMo-V2.6-Flash,由小米大模型Core团队开发。我可以帮你解答问题、提供信息、陪你聊天,随时准备为你服务哦~",
                "role": "assistant",
                "tool_calls": null,
                "reasoning_content": "好的,用户的问题是直接要求我介绍自己,这可能是在测试我的身份或寻求基本信息。深层需求是确认我是小米自研的AI助手,而不是其他模型。根据首要原则,我需要友善、积极地回应,突出自己的核心角色和功能,避免任何真实身份混淆。简要分析:关键点包括我的名字、作为小米MiMo的身份、开发团队、能力如解答和陪伴,以及保持轻快亲切的风格。拟定回答结构:先热情打招呼,然后自我介绍主体,最后表达服务意愿。"
            }
        }
    ],
    "created": 1790087354,
    "model": "mimo-v2.6-flash",
    "object": "chat.completion",
    "usage": {
        "completion_tokens": 153,
        "prompt_tokens": 23,
        "total_tokens": 176,
        "completion_tokens_details": {
            "reasoning_tokens": 114
        },
        "prompt_tokens_details": {
            "cached_tokens": 0
        }
    }
}

请求参数:

重要提示:由于模型架构不同,部分参数可能仅适用于特定的模型。

messages(对话消息)

  • 参数:messages

  • 必选object

对话消息列表,包含当前对话的完整上下文信息。每条消息都有特定的角色和内容,模型会根据这些消息生成回复。消息按时间顺序排列,支持三种角色:system(系统消息,用于设定 AI 的行为和角色)、user(用户消息,来自用户的输入)、assistant(助手消息,来自 AI 的回复)。普通对话模型主要支持纯文本内容。

messages 格式请参考代码示例。注意:不能只包含系统消息或助手消息。

model(模型 ID)

  • 参数:model

  • 必选string

调用时使用的模型 ID。请使用模型详情页展示的模型 ID。

top_k(Top-K)

  • 参数:top_k

  • 可选,int,>= 0

  • 默认:0

top_k 会限制模型在每一步对 token 的选择,使其从较小的集合中进行选择。值为 1 表示模型将始终选择最有可能的下一个 token,从而得到可预测的结果。

top_a(Top-A)

  • 参数:top_a

  • 可选,float,0.0 到 1.0

  • 默认:0.0

top_a 仅考虑概率“足够高”的 top tokens,该概率基于最可能的 token 概率。可以将其视为一个动态的 Top-P。较低的 Top-A 值会根据概率最高的 token 集中选择,但范围会更窄。较高的 Top-A 值不一定会影响输出的创造性,但会根据最大概率优化过滤过程。

max_tokens(最大 tokens 数)

  • 参数:max_tokens

  • 可选,int,>= 1

max_tokens 可设定模型在响应中可以生成的 token 数量的上限。模型不会生成超过此限制的 token。其最大值等于上下文长度减去 prompt 长度。

logprobs(对数概率)

  • 参数:logprobs

  • 可选,boolean

logprobs 设置是否返回输出 token 的对数概率。如果为 true,则返回每个输出 token 的对数概率。

tools(工具)

  • 参数:tools

  • 可选,array

工具调用参数,遵循 OpenAI 的工具调用请求格式。对于非 OpenAI 提供者,会相应地进行转换。

verbosity(冗长程度)

  • 参数:verbosity

  • 可选,string

  • 取值范围:low | medium | high

  • 默认:medium

控制模型响应的冗长程度和长度。较低的值会生成更简洁的回答,而较高的值会生成更详细、更全面的回答。

logit_bias(Logit Bias)

  • 参数:logit_bias

  • 可选,object

logit_bias 是一个可选参数,用于修改指定 token 在模型生成输出中出现的可能性。

stream(流式输出)

  • 参数:stream

  • 可选,boolean

  • 取值范围:true | false

  • 默认:false

是否开启流式输出。设为 true 时,模型以 SSE 形式逐块返回生成内容;设为 false 时,等待完整响应后一次性返回。

repetition_penalty(重复惩罚)

  • 参数:repetition_penalty

  • 可选,float,0.0 至 2.0

  • 默认:1.0

repetition_penalty 有助于减少输入中标记的重复。较高的值会降低模型重复标记的可能性,但过高的值会使输出不够连贯(通常会出现缺少小词的连续句子)。标记惩罚会根据原始标记的概率进行调整。

seed(种子)

  • 参数:seed

  • 可选,int

如果指定了 seed 参数,推理将确定性地进行采样,即使用相同种子和参数的重复请求应该返回相同的结果。某些模型无法保证确定性。

min_p(Min-P)

  • 参数:min_p

  • 可选,float,0.0 至 1.0

  • 默认:0.0

min_p 表示某个 token 被考虑的最小概率,该概率是相对于最可能的 token 的概率而言的。如果 min_p 设置为 0.1,则意味着它只允许概率至少为最佳选项十分之一的 token 被考虑。

parallel_tool_calls(并行工具调用)

  • 参数:parallel_tool_calls

  • 可选,boolean

  • 默认:true

是否在使用工具时启用并行函数调用。如果为 true,模型可以同时调用多个函数。如果为 false,函数将按顺序依次调用。

frequency_penalty(频率惩罚)

  • 参数:frequency_penalty

  • 可选,float,-2.0 至 2.0

  • 默认:0.0

frequency_penalty 可根据词条在输入中出现的频率来控制其重复使用。它会尝试减少那些在输入中出现频率较高的词条的使用频率,这与它们出现的频率成正比。词条惩罚会随着出现次数的增加而增加。负值将鼓励词条重复使用。

top_p(Top-P)

  • 参数:top_p

  • 可选,float,0.0 至 1.0

  • 默认:1.0

top_p 参数控制模型在生成文本时的候选词选择范围。具体来说,模型会生成一组候选 token,然后从累积概率达到或超过 p 的 token 中随机选择一个作为输出。通过这种方式,top_p 能够在保证生成内容的多样性的同时,考虑到概率分布的合理性。

由于 temperature 与 top_p 均可以控制生成文本的多样性,因此建议您只设置其中一个值。

tool_choice(工具选择)

  • 参数:tool_choice

  • 可选,string | object

  • 默认:auto

工具调用策略。

  • "none":禁止模型调用工具。
  • "auto":自动判断是否调用(默认)。
  • "required":强制模型必须调用一个或多个工具。
  • {"type": "function", "function": {"name": "my_function"}}:指定特定工具会强制模型调用该工具。

stop(停止)

  • 参数:stop

  • 可选,array

如果模型遇到 stop 数组中指定的任意 token,则立即停止生成。

structured_outputs(结构化输出)

  • 参数:structured_outputs

  • 可选,boolean

指示模型是否能够使用 response_format 中的 json_schema 返回结构化输出。

temperature(温度)

  • 参数:temperature

  • 可选,float,0.0 到 2.0

  • 默认:1.0

此设置影响模型回复的多样性。较低的值会使回复更可预测、更常见;较高的值会鼓励更具多样性且较不常见的回复。当设置为 0 时,模型对相同输入将尽可能的给出相同的回复。

top_logprobs(最高对数概率)

  • 参数:top_logprobs

  • 可选,int,0 至 20

top_logprobs 是一个介于 0 和 20 之间的整数,指定在每个 token 位置要返回的最可能 token 的数量,每个 token 都会带有相应的对数概率。如果使用此参数,则必须将 logprobs 设置为 true

response_format(响应格式)

  • 参数:response_format

  • 可选,object

response_format 强制模型产出特定的输出格式。将其设置为 { "type": "json_object" } 可启用 JSON 模式,保证模型生成的消息为有效的 JSON。

注意:使用 JSON 模式时,应同时通过 system 或 user 提示词指示模型生成 JSON。

presence_penalty(存在惩罚)

  • 参数:presence_penalty

  • 可选,float,-2.0 至 2.0

  • 默认:0.0

presence_penalty 调整模型重复输入中已使用的特定标记的频率。值越高,重复的可能性就越小,负值则相反。标记惩罚不会随着出现次数而变化。负值会鼓励标记重用。


以上文档为标准版 API 接口文档,可直接用于项目开发和系统调用。如果标准版 API 接口无法满足您的需求,需要定制开发 API 接口,请联系我们的 IT 技术支持工程师:

(沟通需求✅ → 确认技术方案✅ → 沟通费用与工期✅ → 开发&测试✅ → 验收交付✅ → 维护升级✅)

最受关注模型

DeepSeek V4 Pro

文本生成、深度思考

DeepSeek V4 Flash

文本生成、深度思考

Tencent Hunyuan Hy3

文本生成、深度思考、Agent增强

Doubao Seedream 5.0 Pro

图片生成

GLM 5.3 Flash

多模态输入、深度思考

最新发布模型

XiaoMi MiMo-V2.6-Pro

文本生成、深度思考

Xiaomi MiMo-V2.6-Flash

文本生成、深度思考

HY image 3.5 preview

图片生成

Qwen Audio 3.1 TTS Flash

语音合成

GLM 5.3 FlashX

多模态、深度思考、推理优化

向量化模型

Qwen3.7 Text Embedding

文本向量化

GLM Embedding 3

文本向量化

Qwen3 Embedding 8B

文本嵌入、文本向量化

Doubao Embedding Large Text 250515

文本向量化

Qwen Text Embedding V4

文本向量化

语音识别模型

MiMo V2.5 ASR

音频识别

Fun ASR Flash

语音识别、方言识别

Qwen3 ASR Flash

语音识别

GLM ASR 2512

语音识别

语音合成模型

Qwen Audio 3.1 TTS Flash

语音合成

Qwen Audio 3.0 TTS Plus

语音合成

Qwen Audio 3.0 TTS Flash

语音合成

CosyVoice V3 Plus

语音合成

CosyVoice V3 Flash

语音合成