DeepSeek V4.1 Flash API 接口、参数 & 代码示例

deepseek/deepseek-v4.1-flash

DeepSeek V4.1 Flash 是 DeepSeek 全新发布的低推理成本 + 高吞吐 + 高 Agent/编程能力 + 原生视觉的模型,具备原生多模态视觉理解能力。作为全新模型结构系列中的首发小尺寸版本,DeepSeek V4.1 Flash 在保持极低推理成本的同时,实现了多项综合能力超越上一代旗舰模型 V4 Pro。

模型 ID
deepseek/deepseek-v4.1-flash
模型系列
DeepSeek
更新日期
模型能力
文本生成、深度思考、原生视觉
上下文长度
1024 K
模型价格(每 1000 tokens 输入)
¥ 0.0015
模型价格(每 1000 tokens 输出)
¥ 0.0045

DeepSeek V4.1 Flash 模型介绍:

DeepSeek V4.1 Flash 是 DeepSeek 全新发布的低推理成本 + 高吞吐 + 高 Agent/编程能力 + 原生视觉的模型,具备原生多模态视觉理解能力。作为全新模型结构系列中的首发小尺寸版本,DeepSeek V4.1 Flash 在保持极低推理成本的同时,实现了多项综合能力超越上一代旗舰模型 V4 Pro。

核心技术与技术指标:

  • 架构创新(Causal-Encoder-Decoder):采用全新的非对称因果编码器-解码器结构,总参数量为 552B,但运行时输入激活仅 8B,输出激活 16B,大幅提升了并行吞吐量并显著降低资源消耗。
  • 原生多模态支持:原生具备图文一体化的视觉理解与文本生成能力,无需挂载额外的外部视觉插件或 Vision 实验版本,统一了单模态与多模态的调用逻辑。
  • 性能与成本极致优化:在综合能力、生成速度、响应时延以及单位 Token 费用等指标上全面超越 V4 Pro,代表了更高性价比的工业级模型路线。

DeepSeek V4.1 Flash 是 DeepSeek V4 系列的新一代 Flash 模型,而且官方称它是新架构家族中规模最小的成员。它的设计目标不是单纯追求参数量,而是让:模型能力上限更高 → 推理更快 → 单位成本更低 → 吞吐更高 → 未来可以扩展到更大的模型。

模型架构:

项目 DeepSeek V4.1 Flash
总参数量 552B
输入侧激活参数 8B
输出侧激活参数 16B
架构 Causal Encoder–Decoder
MoE
原生多模态

模型定位:

  • Coding Agent
  • 长任务 Agent
  • 大规模 API 调用
  • 自动化工作流
  • 批量文本处理
  • 搜索/研究 Agent
  • 工具调用
  • 高并发应用

原生多模态:

DeepSeek V4.1 Flash 从模型架构层面支持视觉理解,是把多模态能力直接纳入新的模型架构。

  • 截图理解
  • UI 分析
  • 图表分析
  • 文档图片
  • OCR + 推理
  • 编程截图
  • Agent 视觉任务

Benchmark:

Benchmark DeepSeek V4.1 Flash
GPQA Diamond 90.9
HLE 36.8
HLE(纯文本子集) 39.1
Codeforces Rating 3471
MathArena Apex 65.6
Terminal-Bench 2.1 90.6
Terminal-Bench 3.0 30.0
Terminal-Bench 4.0 31.2
DeepSWE v1.1 74.2
ProgramBench 20.3
NL2Repo-Bench 65.4
CyberGym 88.1
SEC-Bench Pro 62.8
ExploitGym 15.3
HLE(with tools) 63.9
Automation-Bench 54.8
Agents' Last Exam 31.8
Chartography(with tools) 78.9
BabyVision(with tools) 89.6
ZeroBench-main 49.0

应用场景:

  1. Coding,超长上下文 + 工具调用 + 多轮循环 + 大量输入 + 少量最终输出
Coding Agent
        ↓
读代码
        ↓
调用 shell
        ↓
运行测试
        ↓
分析错误
        ↓
修改代码
        ↓
再次测试
  1. Task Agent,强的工具任务能力 + 长上下文取向 + 低成本
  • Search Agent
  • Browser Agent
  • Computer-use
  • Research Agent
  • Workflow Agent
  • 自动化编程 Agent
  • 多工具协作
  1. 大规模 API,单 Token 成本 + 吞吐 + 延迟

场景示例:

100 万个请求
↓
分类
↓
抽取
↓
总结
↓
结构化 JSON
↓
再交给另一个模型
  1. 视觉 + Agent,原生多模态视觉能力

场景示例:

用户截图
↓
模型理解页面
↓
识别按钮
↓
分析错误
↓
调用工具
↓
继续操作

API 接口地址:

  • Chat Completions API:

    https://wcode.net/api/gpt/v1/chat/completions

  • Anthropic API:

    https://wcode.net/api/anthropic/v1/messages

此 API 接口兼容 OpenAI 的 API 接口规范,可直接使用 OpenAI 的 SDK 来调用各个模型。仅需替换以下配置即可:

  1. base_url 替换为 https://wcode.net/api/gpt/v1
  2. api_key 替换为从 https://platform.wcode.net 获取到的 API Key

具体可参考下方的各编程语言代码示例中的 OpenAI SDK 调用示例。

此模型支持 Anthropic / Claude 的 API 接口规范,可直接使用 Anthropic 的 SDK 来调用此模型。仅需替换以下配置即可:

  1. ANTHROPIC_BASE_URL 替换为 https://wcode.net/api/anthropic
  2. ANTHROPIC_API_KEY(或 ANTHROPIC_AUTH_TOKEN)替换为从 https://platform.wcode.net 获取到的 API Key
  3. ANTHROPIC_MODEL(或model)替换为 deepseek/deepseek-v4.1-flash

请求方法:

POST

各编程语言代码示例:

# TODO: 以下代码中的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
curl --request POST 'https://wcode.net/api/gpt/v1/chat/completions' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer API_KEY' \
--data '{
    "model": "deepseek/deepseek-v4.1-flash",
    "messages": [
        {
            "role": "user",
            "content": "你好"
        }
    ]
}'
import Foundation

let headers = [
  "Authorization": "Bearer API_KEY",  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  "content-type": "application/json"
]
let parameters = [
  "model": "deepseek/deepseek-v4.1-flash",
  "messages": [
    [
      "role": "user",
      "content": "你好"
    ]
  ]
] as [String : Any]

let postData = JSONSerialization.data(withJSONObject: parameters, options: [])

let request = NSMutableURLRequest(url: NSURL(string: "https://wcode.net/api/gpt/v1/chat/completions")! as URL,
                                        cachePolicy: .useProtocolCachePolicy,
                                    timeoutInterval: 60.0)
request.httpMethod = "POST"
request.allHTTPHeaderFields = headers
request.httpBody = postData as Data

let session = URLSession.shared
let dataTask = session.dataTask(with: request as URLRequest, completionHandler: { (data, response, error) -> Void in
  if (error != nil) {
    print(error as Any)
  } else {
    let httpResponse = response as? HTTPURLResponse
    print(httpResponse)
  }
})

dataTask.resume()
var headers = {
  'Content-Type': 'application/json',
  'Authorization': 'Bearer API_KEY'  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
};
var request = http.Request('POST', Uri.parse('https://wcode.net/api/gpt/v1/chat/completions'));
request.body = json.encode({
  "model": "deepseek/deepseek-v4.1-flash",
  "messages": [
    {
      "role": "user",
      "content": "你好"
    }
  ]
});
request.headers.addAll(headers);

http.StreamedResponse response = await request.send();

if (response.statusCode == 200) {
  print(await response.stream.bytesToString());
}
else {
  print(response.reasonPhrase);
}
require 'uri'
require 'net/http'

url = URI("https://wcode.net/api/gpt/v1/chat/completions")

http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true

request = Net::HTTP::Post.new(url)
request["Authorization"] = 'Bearer API_KEY'  # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
request["content-type"] = 'application/json'
request.body = "{\"model\":\"deepseek/deepseek-v4.1-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}"

response = http.request(request)
puts response.read_body
use serde_json::json;
use reqwest;

#[tokio::main]
pub async fn main() {
  let url = "https://wcode.net/api/gpt/v1/chat/completions";

  let payload = json!({
    "model": "deepseek/deepseek-v4.1-flash",
    "messages": (
      json!({
        "role": "user",
        "content": "你好"
      })
    )
  });

  let mut headers = reqwest::header::HeaderMap::new();
  headers.insert("Authorization", "Bearer API_KEY".parse().unwrap());  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  headers.insert("content-type", "application/json".parse().unwrap());

  let client = reqwest::Client::new();
  let response = client.post(url)
    .headers(headers)
    .json(&payload)
    .send()
    .await;

  let results = response.unwrap()
    .json::<serde_json::Value>()
    .await
    .unwrap();

  dbg!(results);
}
CURL *hnd = curl_easy_init();

curl_easy_setopt(hnd, CURLOPT_CUSTOMREQUEST, "POST");
curl_easy_setopt(hnd, CURLOPT_URL, "https://wcode.net/api/gpt/v1/chat/completions");

struct curl_slist *headers = NULL;
headers = curl_slist_append(headers, "Authorization: Bearer API_KEY");  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
headers = curl_slist_append(headers, "content-type: application/json");
curl_easy_setopt(hnd, CURLOPT_HTTPHEADER, headers);

curl_easy_setopt(hnd, CURLOPT_POSTFIELDS, "{\"model\":\"deepseek/deepseek-v4.1-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}");

CURLcode ret = curl_easy_perform(hnd);
package main

import (
  "fmt"
  "strings"
  "net/http"
  "io"
)

func main() {
  url := "https://wcode.net/api/gpt/v1/chat/completions"

  payload := strings.NewReader("{\"model\":\"deepseek/deepseek-v4.1-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}")

  req, _ := http.NewRequest("POST", url, payload)

  req.Header.Add("Authorization", "Bearer API_KEY")  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  req.Header.Add("content-type", "application/json")

  res, _ := http.DefaultClient.Do(req)

  defer res.Body.Close()
  body, _ := io.ReadAll(res.Body)

  fmt.Println(res)
  fmt.Println(string(body))
}
using System.Net.Http.Headers;


var client = new HttpClient();

var request = new HttpRequestMessage(HttpMethod.Post, "https://wcode.net/api/gpt/v1/chat/completions");

request.Headers.Add("Authorization", "Bearer API_KEY");  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net

request.Content = new StringContent("{\"model\":\"deepseek/deepseek-v4.1-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}", null, "application/json");

var response = await client.SendAsync(request);

response.EnsureSuccessStatusCode();

Console.WriteLine(await response.Content.ReadAsStringAsync());
var client = new RestClient("https://wcode.net/api/gpt/v1/chat/completions");

var request = new RestRequest("", Method.Post);

request.AddHeader("Authorization", "Bearer API_KEY");  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net

request.AddHeader("content-type", "application/json");

request.AddParameter("application/json", "{\"model\":\"deepseek/deepseek-v4.1-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}", ParameterType.RequestBody);

var response = client.Execute(request);
const axios = require('axios');

let data = JSON.stringify({
  "model": "deepseek/deepseek-v4.1-flash",
  "messages": [
    {
      "role": "user",
      "content": "你好"
    }
  ]
});

let config = {
  method: 'post',
  maxBodyLength: Infinity,
  url: 'https://wcode.net/api/gpt/v1/chat/completions',
  headers: {
    'Content-Type': 'application/json',
    'Authorization': 'Bearer API_KEY'  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  },
  data : data
};

axios.request(config).then((response) => {
  console.log(JSON.stringify(response.data));
}).catch((error) => {
  console.log(error);
});
OkHttpClient client = new OkHttpClient();

MediaType mediaType = MediaType.parse("application/json");

RequestBody body = RequestBody.create(mediaType, "{\"model\":\"deepseek/deepseek-v4.1-flash\",\"messages\":[{\"role\":\"user\",\"content\":\"你好\"}]}");

Request request = new Request.Builder()
  .url("https://wcode.net/api/gpt/v1/chat/completions")
  .post(body)
  .addHeader("Authorization", "Bearer API_KEY")  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  .addHeader("content-type", "application/json")
  .build();

Response response = client.newCall(request).execute();
$client = new \GuzzleHttp\Client();

$headers = [
  'Content-Type' => 'application/json',
  'Authorization' => 'Bearer API_KEY',  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
];

$body = '{
  "model": "deepseek/deepseek-v4.1-flash",
  "messages": [
    {
      "role": "user",
      "content": "你好"
    }
  ]
}';

$request = new \GuzzleHttp\Psr7\Request('POST', 'https://wcode.net/api/gpt/v1/chat/completions', $headers, $body);

$response = $client->sendAsync($request)->wait();

echo $response->getBody();
$curl = curl_init();

curl_setopt_array($curl, [
  CURLOPT_URL => "https://wcode.net/api/gpt/v1/chat/completions",
  CURLOPT_RETURNTRANSFER => true,
  CURLOPT_ENCODING => "",
  CURLOPT_MAXREDIRS => 5,
  CURLOPT_TIMEOUT => 300,
  CURLOPT_CUSTOMREQUEST => "POST",
  CURLOPT_POSTFIELDS => json_encode([
    'model' => 'deepseek/deepseek-v4.1-flash',
    'messages' => [
      [
        'role' => 'user',
        'content' => '你好'
      ]
    ]
  ]),
  CURLOPT_HTTPHEADER => [
    "Authorization: Bearer API_KEY",  // TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
    "content-type: application/json",
  ],
]);

$response = curl_exec($curl);
$error = curl_error($curl);

curl_close($curl);

if ($error) {
  echo "cURL Error #:" . $error;
} else {
  echo $response;
}
import requests
import json

url = "https://wcode.net/api/gpt/v1/chat/completions"

payload = {
  "model": "deepseek/deepseek-v4.1-flash",
  "messages": [
    {
      "role": "user",
      "content": "你好"
    }
  ]
}

headers = {
  "Authorization": "Bearer API_KEY",  # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
  "content-type": "application/json"
}

response = requests.post(url, json=payload, headers=headers)

print(json.dumps(response.json(), indent=4, ensure_ascii=False))
from openai import OpenAI

client = OpenAI(
  base_url="https://wcode.net/api/gpt/v1",
  api_key="API_KEY"  # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
)

completion = client.chat.completions.create(
  model="deepseek/deepseek-v4.1-flash",
  messages=[
    {
      "role": "user",
      "content": "你好"
    }
  ]
)

print(completion.choices[0].message.content)

各 AI 产品/工具/第三方应用接入示例:

配置 Hermes Agent 使用 DeepSeek V4.1 Flash 模型

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

方式一:交互式配置

在命令行输入 hermes model,然后选择 Custom endpoint 选项,根据交互式命令引导,分别配置以下信息:

  • API base URL:https://wcode.net/api/gpt/v1
  • API Key:<API_KEY>
  • Model:deepseek/deepseek-v4.1-flash

方式二:手动配置

修改 config.yaml(通常位于~/.hermes/config.yaml

model:
  default: "deepseek/deepseek-v4.1-flash"
  provider: custom
  base_url: "https://wcode.net/api/gpt/v1"
  api_key: "<API_KEY>"
  context_length: 1024000

配置完成后,就可以开始使用 Hermes Agent ~

配置 Roo Code 使用 DeepSeek V4.1 Flash 模型

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

  • API Provider:OpenAI Compatible
  • Base URL:https://wcode.net/api/gpt/v1
  • API Key:<API_KEY>
  • Model:deepseek/deepseek-v4.1-flash

配置完成后,就可以开始使用 Roo Code ~

配置 Kilo Code 使用 DeepSeek V4.1 Flash 模型

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

选择 Use your own API key,然后配置以下信息:

  • API Provider:OpenAI Compatible
  • Base URL:https://wcode.net/api/gpt/v1
  • API Key:<API_KEY>
  • Model:deepseek/deepseek-v4.1-flash

配置完成后,就可以开始使用 Kilo Code ~

配置 Cline 使用 DeepSeek V4.1 Flash 模型

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

  • API Provider:OpenAI Compatible
  • Base URL:https://wcode.net/api/gpt/v1
  • API Key:<API_KEY>
  • Model ID:deepseek/deepseek-v4.1-flash

配置完成后,就可以开始使用 Cline ~

注:以下安装和配置过程以 Ubuntu Server 24.04 (root 用户) + Node 22 安装 OpenClaw 🦞 2026.3.8 为例

安装 🦞 OpenClaw(龙虾),步骤如下:

  1. 命令行执行 npm install -g openclaw@latest
  2. 命令行执行 openclaw onboard --install-daemon
  3. I understand this is personal-by-default and shared/multi-user use requires lock-down. Continue? 选择 yes
  4. Onboarding mode 选择 QuickStart
  5. Model/auth provider 选择 Skip for now
  6. Default model 选择 Keep current (default: ...)
  7. Select channel (QuickStart) 选择 Skip for now
  8. Web search 选择 Skip for now
  9. Configure skills now? (recommended) 选择 No
  10. Enable hooks? (这是一个多选,按空格键可选中选项)按空格键选中 📝 command-logger💾 session-memory 这两个选项,然后按回车键进入下一步
  11. (如有) How do you want to hatch your bot? 选择 Hatch in TUI (recommended)

配置 🦞 OpenClaw(龙虾)使用 DeepSeek V4.1 Flash 模型:

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取(创建)的 API Key

推荐方式:修改 openclaw.json(通常位于~/.openclaw/openclaw.json

找到openclaw.json的第一层级的modelsagents属性(如果没有则在第一层级添加modelsagents属性),改为如下配置:

{
  ...其他配置,

  "models": {
      "mode": "merge",
      "providers": {
          "wcode": {
              "baseUrl": "https://wcode.net/api/gpt/v1",
              "apiKey": "<API_KEY>",
              "api": "openai-completions",
              "models": [
                  {
                      "id": "deepseek/deepseek-v4.1-flash",
                      "name": "DeepSeek V4.1 Flash",
                      "reasoning": false,
                      "input": ["text"],
                      "contextWindow": 1024000,
                      "maxTokens": 8192
                  }
              ]
          }
      }
  },
  "agents": {
      "defaults": {
         "model": {
             "primary": "wcode/deepseek/deepseek-v4.1-flash"
         }
      }
  },

  ...其他配置
}

完成以上配置后,

  1. 执行以下命令,即可通过命令行的方式开始对话:
openclaw tui
  1. 执行以下命令,即可通过 Web 界面的方式开始对话:
openclaw dashboard

配置 OpenCode 使用 DeepSeek V4.1 Flash 模型

推荐方式:修改 opencode.json(通常位于~/.config/opencode/opencode.json

注意事项:以下配置中的 <API_KEY> 需要替换为从 https://platform.wcode.net 获取的 API Key

配置如下:

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "myprovider": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "wcode",
      "options": {
        "baseURL": "https://wcode.net/api/gpt/v1",
        "apiKey": "<API_KEY>"
      },
      "models": {
        "deepseek/deepseek-v4.1-flash": {
          "name": "DeepSeek V4.1 Flash"
        }
      }
    }
  }
}

完成以上配置后,执行以下命令,即可启动 OpenCode:

opencode

输入 /models,选择配置的 deepseek/deepseek-v4.1-flash 模型并在 OpenCode 中使用。

API 响应示例(curl):

{
    "id": "chatcmpl-t1789026757s283rf8feef1a861368a79163bdd7",
    "object": "chat.completion",
    "created": 1789026757,
    "model": "deepseek-flash",
    "choices": [
        {
            "index": 0,
            "message": {
                "role": "assistant",
                "content": "你好!我是 **DeepSeek**,一个由深度求索公司开发的人工智能助手。你可以把我当作一个随时在线的中文/多语言对话伙伴。\n\n我可以帮你做这些事:\n\n- **回答问题**:解释概念、查资料式整理、分析问题\n- **写作与润色**:文章、文案、邮件、总结、改写、翻译\n- **编程相关**:写代码、调试、解释算法、给实现思路\n- **学习与工作**:制定计划、整理笔记、头脑风暴、提炼重点\n- **日常聊天**:陪你讨论想法、提供建议\n\n我的特点是:支持多轮对话,回答尽量清晰、准确、有条理;可以用中文、英文等多种语言交流。\n\n我也有一些限制:知识可能不是实时最新;不能直接替你在现实世界里操作事情;重要信息建议你再核实一下。如果需要最新信息,通常可以开启联网搜索或把资料发给我。\n\n有什么想让我帮忙的吗?",
                "reasoning_content": "我们需要回答用户。用户说“你好,DeepSeek,请介绍一下你自己”。但我们实际是 AI 助手?根据 system:我是 DeepSeek?需要介绍自己。注意不要声称是 DeepSeek 如果实际模型身份?系统说“You are an AI assistant accessed via an API.” 没有明确名字。用户称呼 DeepSeek。作为助手,可以回应。需要中文。应该介绍自己:我是 DeepSeek 最新版模型? 实际政策? 我们应准确:我是 DeepSeek 研发的 AI 助手? 当前日期 2026-05-09,模型版本可能未知。DeepSeek 可能有 V3? 系统无信息。最好不编造具体版本。可介绍能力:文本对话、问答、写作、编程、翻译、文件处理? API 访问,不能直接浏览?需要看 OpenAI compatible? 通常 DeepSeek 模型可处理文本,支持上传文件读取文本? 在网页/App 中可上传图像、PDF、Word、Excel、PPT、TXT 并读取文字;可以联网搜索需手动开启。这里没有工具说明,不应承诺联网。可简洁介绍。\n\n需要应对用户“你好,DeepSeek”:可以答“你好!我是 DeepSeek,一个由深度求索公司开发的 AI 助手。” 但若我是通过 API 的 AI 助手,可能不能直接称 DeepSeek? 可是用户明确。最好以通用身份:“你好!我是 AI 助手(你可以叫我 DeepSeek)”。也许正确:我是 DeepSeek,由深度求索公司创造的人工智能助手。我的知识截止日期? DeepSeek V3 知识截止 2024-07? 当前 2026。不能确定。若不准确,可不说。\n\n需要介绍自己:能做什么、特点、限制。可提到:免费? 在官方渠道可能免费。API 计费? 不要说。可支持长上下文? DeepSeek V3 128K? 不编造。当前模型可能 128K。但系统没给,最好泛化。\n\n可以回答:\n你好!我是 DeepSeek,一个由深度求索(DeepSeek)公司开发的人工智能助手。我可以帮你:\n- 回答问题、解释概念、整理资料\n- 写作、润色、翻译、总结\n- 编程、调试、算法思路\n- 头脑风暴、学习规划、日常咨询\n我支持多轮对话,通常能用中文/英文等多种语言交流。回答尽量清晰、准确、有条理。\n限制:知识可能不是实时最新;不能直接执行现实世界操作;若需最新信息,请开启联网搜索或提供资料;我可能会犯错,重要信息请核实。\n有什么我可以帮你的?\n\n可以提及“不是人类”。如果用户问“DeepSeek”也许要介绍公司? 但最好以第一人称。\n\n注意我们被要求“你好,DeepSeek,请介绍一下你自己”。直接回答。避免过度。可以友好。\n\n需要处理身份:作为 AI 助手,访问 API。通常不应该说“我是 DeepSeek 最新版模型”如果不知道。可以说“我是 DeepSeek 提供的 AI 助手”。这安全。\n\n最终答案中文,简洁。可以包含 emoji? 合适。\n\n需要遵守:没有额外。最终直接回答。"
            },
            "logprobs": null,
            "finish_reason": "stop"
        }
    ],
    "usage": {
        "prompt_tokens": 39,
        "completion_tokens": 890,
        "total_tokens": 929,
        "prompt_tokens_details": {
            "cached_tokens": 0
        },
        "completion_tokens_details": {
            "reasoning_tokens": 691
        },
        "prompt_cache_hit_tokens": 0,
        "prompt_cache_miss_tokens": 39
    },
    "system_fingerprint": "aeb56401ca74e127821c4f9126dcb669"
}

请求参数:

重要提示:由于模型架构不同,部分参数可能仅适用于特定的模型。

messages(对话消息)

  • 参数:messages

  • 必选object

对话消息列表,包含当前对话的完整上下文信息。每条消息都有特定的角色和内容,模型会根据这些消息生成回复。消息按时间顺序排列,支持三种角色:system(系统消息,用于设定 AI 的行为和角色)、user(用户消息,来自用户的输入)、assistant(助手消息,来自 AI 的回复)。普通对话模型主要支持纯文本内容。

messages 格式请参考代码示例。注意:不能只包含系统消息或助手消息。

model(模型 ID)

  • 参数:model

  • 必选string

调用时使用的模型 ID。请使用模型详情页展示的模型 ID。

top_k(Top-K)

  • 参数:top_k

  • 可选,int,>= 0

  • 默认:0

top_k 会限制模型在每一步对 token 的选择,使其从较小的集合中进行选择。值为 1 表示模型将始终选择最有可能的下一个 token,从而得到可预测的结果。

top_a(Top-A)

  • 参数:top_a

  • 可选,float,0.0 到 1.0

  • 默认:0.0

top_a 仅考虑概率“足够高”的 top tokens,该概率基于最可能的 token 概率。可以将其视为一个动态的 Top-P。较低的 Top-A 值会根据概率最高的 token 集中选择,但范围会更窄。较高的 Top-A 值不一定会影响输出的创造性,但会根据最大概率优化过滤过程。

max_tokens(最大 tokens 数)

  • 参数:max_tokens

  • 可选,int,>= 1

max_tokens 可设定模型在响应中可以生成的 token 数量的上限。模型不会生成超过此限制的 token。其最大值等于上下文长度减去 prompt 长度。

logprobs(对数概率)

  • 参数:logprobs

  • 可选,boolean

logprobs 设置是否返回输出 token 的对数概率。如果为 true,则返回每个输出 token 的对数概率。

tools(工具)

  • 参数:tools

  • 可选,array

工具调用参数,遵循 OpenAI 的工具调用请求格式。对于非 OpenAI 提供者,会相应地进行转换。

verbosity(冗长程度)

  • 参数:verbosity

  • 可选,string

  • 取值范围:low | medium | high

  • 默认:medium

控制模型响应的冗长程度和长度。较低的值会生成更简洁的回答,而较高的值会生成更详细、更全面的回答。

logit_bias(Logit Bias)

  • 参数:logit_bias

  • 可选,object

logit_bias 是一个可选参数,用于修改指定 token 在模型生成输出中出现的可能性。

stream(流式输出)

  • 参数:stream

  • 可选,boolean

  • 取值范围:true | false

  • 默认:false

是否开启流式输出。设为 true 时,模型以 SSE 形式逐块返回生成内容;设为 false 时,等待完整响应后一次性返回。

repetition_penalty(重复惩罚)

  • 参数:repetition_penalty

  • 可选,float,0.0 至 2.0

  • 默认:1.0

repetition_penalty 有助于减少输入中标记的重复。较高的值会降低模型重复标记的可能性,但过高的值会使输出不够连贯(通常会出现缺少小词的连续句子)。标记惩罚会根据原始标记的概率进行调整。

seed(种子)

  • 参数:seed

  • 可选,int

如果指定了 seed 参数,推理将确定性地进行采样,即使用相同种子和参数的重复请求应该返回相同的结果。某些模型无法保证确定性。

min_p(Min-P)

  • 参数:min_p

  • 可选,float,0.0 至 1.0

  • 默认:0.0

min_p 表示某个 token 被考虑的最小概率,该概率是相对于最可能的 token 的概率而言的。如果 min_p 设置为 0.1,则意味着它只允许概率至少为最佳选项十分之一的 token 被考虑。

parallel_tool_calls(并行工具调用)

  • 参数:parallel_tool_calls

  • 可选,boolean

  • 默认:true

是否在使用工具时启用并行函数调用。如果为 true,模型可以同时调用多个函数。如果为 false,函数将按顺序依次调用。

reasoning(思考模式推理程度)

  • 参数:reasoning

  • 可选,object

  • 默认:-

reasoning 参数整合了用于控制不同模型间推理强度的设置:

  • "effort": "xhigh" - 分配最大比例的 token 用于推理(约占 max_tokens 的 95%)
  • "effort": "high" - 分配较大比例的 token 用于推理(约占 max_tokens 的 80%)
  • "effort": "medium" - 分配中等比例的 token 用于推理(约占 max_tokens 的 50%)
  • "effort": "low" - 分配较小比例的 token 用于推理(约占 max_tokens 的 20%)
  • "effort": "minimal" - 分配更小比例的 token 用于推理(约占 max_tokens 的 10%)
  • "effort": "none" - 完全禁用推理

curl 代码示例:

# TODO 1: 以下代码中的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
# TODO 2: 以下代码中的 MODEL_ID 需要替换,模型列表:https://wcode.net/models
curl --request POST 'https://wcode.net/api/gpt/v1/chat/completions' \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer API_KEY' \
--data '{
    "model": "MODEL_ID",
    "messages": [
        {
            "role": "user",
            "content": "你好"
        }
    ],
    "reasoning": {
        "effort": "high"
    }
}'

Python OpenAI SDK 代码示例:

from openai import OpenAI

client = OpenAI(
  base_url="https://wcode.net/api/gpt/v1",
  api_key="API_KEY"                             # TODO: 这里的 API_KEY 需要替换,获取 API Key 入口:https://platform.wcode.net
)

completion = client.chat.completions.create(
  model="MODEL_ID",                             # TODO: 这里的 MODEL_ID 需要替换,模型列表:https://wcode.net/models
  messages=[
    {
      "role": "user",
      "content": "天空为什么是蓝色的?"
    }
  ],
  extra_body={
    "reasoning": {
      "effort": "high"
    }
  }
)

print(completion.choices[0].message.content)

frequency_penalty(频率惩罚)

  • 参数:frequency_penalty

  • 可选,float,-2.0 至 2.0

  • 默认:0.0

frequency_penalty 可根据词条在输入中出现的频率来控制其重复使用。它会尝试减少那些在输入中出现频率较高的词条的使用频率,这与它们出现的频率成正比。词条惩罚会随着出现次数的增加而增加。负值将鼓励词条重复使用。

top_p(Top-P)

  • 参数:top_p

  • 可选,float,0.0 至 1.0

  • 默认:1.0

top_p 参数控制模型在生成文本时的候选词选择范围。具体来说,模型会生成一组候选 token,然后从累积概率达到或超过 p 的 token 中随机选择一个作为输出。通过这种方式,top_p 能够在保证生成内容的多样性的同时,考虑到概率分布的合理性。

由于 temperature 与 top_p 均可以控制生成文本的多样性,因此建议您只设置其中一个值。

tool_choice(工具选择)

  • 参数:tool_choice

  • 可选,string | object

  • 默认:auto

工具调用策略。

  • "none":禁止模型调用工具。
  • "auto":自动判断是否调用(默认)。
  • "required":强制模型必须调用一个或多个工具。
  • {"type": "function", "function": {"name": "my_function"}}:指定特定工具会强制模型调用该工具。

stop(停止)

  • 参数:stop

  • 可选,array

如果模型遇到 stop 数组中指定的任意 token,则立即停止生成。

thinking(思考模式)

  • 参数:thinking

  • 可选,object

  • 默认:{"type": "enabled"}

用于控制模型的思考模式。以 object 形式传入,通过 type 字段指定模型在回答前是否进行内部推理,以及具体推理策略。

示例

"thinking": {
    "type": "enabled"
}

thinking.type(思考类型)

  • 参数:thinking.type

  • 必选string

  • 取值范围:enabled | disabled

  • 默认:enabled

指定 thinking 对象的 type 字段,控制思考策略。

  • enabled:开启思考模式,模型强制先思考再回答。
  • disabled:关闭思考模式,模型直接回答问题,不进行思考。

structured_outputs(结构化输出)

  • 参数:structured_outputs

  • 可选,boolean

指示模型是否能够使用 response_format 中的 json_schema 返回结构化输出。

temperature(温度)

  • 参数:temperature

  • 可选,float,0.0 到 2.0

  • 默认:1.0

此设置影响模型回复的多样性。较低的值会使回复更可预测、更常见;较高的值会鼓励更具多样性且较不常见的回复。当设置为 0 时,模型对相同输入将尽可能的给出相同的回复。

reasoning_effort(推理强度)

  • 参数:reasoning_effort

  • 可选,string

  • 取值范围:high | max

  • 默认:high

控制模型的推理强度。

top_logprobs(最高对数概率)

  • 参数:top_logprobs

  • 可选,int,0 至 20

top_logprobs 是一个介于 0 和 20 之间的整数,指定在每个 token 位置要返回的最可能 token 的数量,每个 token 都会带有相应的对数概率。如果使用此参数,则必须将 logprobs 设置为 true

response_format(响应格式)

  • 参数:response_format

  • 可选,object

response_format 强制模型产出特定的输出格式。将其设置为 { "type": "json_object" } 可启用 JSON 模式,保证模型生成的消息为有效的 JSON。

注意:使用 JSON 模式时,应同时通过 system 或 user 提示词指示模型生成 JSON。

presence_penalty(存在惩罚)

  • 参数:presence_penalty

  • 可选,float,-2.0 至 2.0

  • 默认:0.0

presence_penalty 调整模型重复输入中已使用的特定标记的频率。值越高,重复的可能性就越小,负值则相反。标记惩罚不会随着出现次数而变化。负值会鼓励标记重用。


以上文档为标准版 API 接口文档,可直接用于项目开发和系统调用。如果标准版 API 接口无法满足您的需求,需要定制开发 API 接口,请联系我们的 IT 技术支持工程师:

(沟通需求✅ → 确认技术方案✅ → 沟通费用与工期✅ → 开发&测试✅ → 验收交付✅ → 维护升级✅)

最受关注模型

DeepSeek V4 Pro

文本生成、深度思考

DeepSeek V4 Flash

文本生成、深度思考

Tencent Hunyuan Hy3

文本生成、深度思考、Agent增强

Doubao Seed 2.1 Pro

多模态、深度思考、图片理解

GLM 5.2

深度思考、长任务能力

最新发布模型

DeepSeek V4.1 Flash

文本生成、深度思考、原生视觉

Tencent Hunyuan Hy4 Preview

Agent、Coding、深度思考

Qwen3.8 Flash

多模态、深度思考

GLM 5.3 Flash

多模态输入、深度思考

DeepSeek V4 Flash Vision Exp

图片理解、深度思考

向量化模型

Qwen3.7 Text Embedding

文本向量化

GLM Embedding 3

文本向量化

Qwen3 Embedding 8B

文本嵌入、文本向量化

Doubao Embedding Large Text 250515

文本向量化

Qwen Text Embedding V4

文本向量化

语音识别模型

MiMo V2.5 ASR

音频识别

Fun ASR Flash

语音识别、方言识别

Qwen3 ASR Flash

语音识别

GLM ASR 2512

语音识别

语音合成模型

Qwen Audio 3.0 TTS Plus

语音合成

Qwen Audio 3.0 TTS Flash

语音合成

CosyVoice V3 Plus

语音合成

CosyVoice V3 Flash

语音合成

GLM TTS

语音合成