筛选
模型列表
共 180 个模型
DeepSeek V3.1
DeepSeek-V3.1 是深度求索全新推出的混合推理模型,支持思考与非思考2种推理模式,较 DeepSeek-R1-0528 思考效率更高。经 Post-Training 优化,Agent 工具使用与智能体任务表现大幅提升。支持 128k 上下文窗口,输出长度支持最大 64k tokens。
文本生成
输入:¥ 0.0021 / 千 tokens
输出:¥ 0.0079 / 千 tokens
Qwen VL Max
通义千问 VL Max(qwen-vl-max),即通义千问超大规模视觉语言模型。相比增强版,Qwen VL Max 再次提升视觉推理能力和指令遵循能力,提供更高的视觉感知和认知水平,在更多复杂任务上提供最佳的性能。
图片理解、视频理解
输入:¥ 0.00175 / 千 tokens
输出:¥ 0.00425 / 千 tokens
Doubao Seed 1.6 Vision
Doubao-Seed-1.6-vision,适用于视频理解、Grounding、GUI Agent 等高复杂度的场景。与 Doubao-1.5-thinking-vision-pro 相比,在教育、图像审核、巡检与安防和 AI 搜索问答等场景下展现出更强的通用多模态理解和推理能力。
视觉识别、深度思考
Qwen Flash
Qwen Flash 是 Qwen3 系列 Flash 模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。复杂推理类任务性能优秀,指令遵循、文本理解等能力显著提高。支持 1M 上下文长度,按照上下文长度进行阶梯计费。
文本生成、深度思考
Qwen3 Coder Flash
Qwen3 Coder Flash 是基于 Qwen3 的代码生成模型,继承 Qwen3 Coder Plus 的 coding agent 能力,支持多轮工具交互,重点优化仓库级别理解能力并增加工具调用稳定性。
文本生成、代码补全
Qwen3 Coder 30B A3B Instruct
Qwen3-Coder-30B-A3B-Instruct是一款拥有305亿参数的混合专家(MoE)模型,采用128个专家组件(每次前向传播激活8个),专为高级代码生成、仓库级代码理解与智能体工具调用而设计。该模型基于Qwen3架构构建,原生支持256K token的上下文长度(可通过Yarn扩展至100万token),在函数调用、浏览器操作和结构化代码补全等任务中表现卓越。
代码生成
输入:¥ 0.00125 / 千 tokens
输出:¥ 0.00375 / 千 tokens
Qwen3 30B A3B Instruct 2507
Qwen3-30B-A3B-Instruct-2507是千问团队开发的305亿参数专家混合语言模型,每次推理仅激活33亿参数。该模型采用非思考模式运行,专注于高质量指令遵循、多语言理解和代理工具使用能力。经过指令数据后训练后,在推理(AIME、斑马逻辑)、编程(MultiPL-E、LiveCodeBench)和对齐(IFEval、写作评测)等基准测试中展现出卓越性能。该模型在主观开放任务上显著优于非指令微调版本,同时保持了强劲的事实问答和代码生成能力。
文本生成
输入:¥ 0.0008 / 千 tokens
输出:¥ 0.0032 / 千 tokens
Qwen3 235B A22B Thinking 2507
Qwen3-235B-A22B-Thinking-2507 是一款高性能开放权重专家混合模型(MoE),专为复杂推理任务优化。该模型在前向推理过程中激活2350亿总参数中的220亿参数,原生支持高达262,144个token的上下文长度。此"纯思考"变体增强了结构化逻辑推理、数理科学及长文本生成能力,在AIME、SuperGPQA、LiveCodeBench和MMLU-Redux等基准测试中表现卓越。该模型经过指令微调,在逐步推理、工具使用、智能体工作流和多语言任务方面表现突出。此次发布的版本是Qwen3-235B系列中能力最强的开源变体,在结构化推理用例中超越诸多闭源模型。
文本生成
输入:¥ 0.00275 / 千 tokens
输出:¥ 0.0095 / 千 tokens
GLM 4.5
GLM-4.5 是智谱团队最新推出的旗舰级基础模型,专为智能体应用打造。GLM-4.5 模型采用专家混合架构(MoE),支持高达 128K tokens 的上下文长度,在推理能力、代码生成和智能体对齐方面实现显著提升。GLM-4.5 提供双模式混合推理:专为复杂推理和工具使用设计的"思考模式",以及针对即时响应优化的"非思考模式"。模型可以通过 `"reasoning": {"enabled": true}` 参数来控制推理行为。
文本生成
输入:¥ 0.0055 / 千 tokens
输出:¥ 0.02 / 千 tokens
GLM 4.5 Air
GLM-4.5-Air 是智谱团队推出的旗舰模型系列的轻量化版本,同样专为以智能体为核心的应用场景打造。与 GLM-4.5 相同,该模型采用专家混合架构(MoE),但参数规模更为紧凑。GLM-4.5-Air 同样支持混合推理模式,提供适用于复杂推理与工具使用的"思考模式",以及满足实时交互需求的"非思考模式"。模型可以通过 `"reasoning": {"enabled": true}` 参数来控制推理行为。
文本生成
输入:¥ 0.0019 / 千 tokens
输出:¥ 0.0129 / 千 tokens
Qwen3 Coder
基于Qwen3的代码生成模型,具有强大的Coding Agent能力,擅长工具调用和环境交互,能够实现自主编程、代码能力卓越的同时兼具通用能力。
代码生成
输入:¥ 0.00375 / 千 tokens
输出:¥ 0.015 / 千 tokens
Qwen3 235B A22B Instruct 2507
Qwen3-235B-A22B-Instruct-2507 是基于 Qwen3-235B 架构的多语言、指令微调的混合专家(Mixture-of-Experts,MoE)语言模型,每次前向传递激活 22B 个参数(约 220 亿)。它针对通用文本生成进行了优化,包括指令跟随、逻辑推理、数学、代码和工具使用。该模型原生支持 256K 的上下文长度,且不实现“思考模式”。与基础版本相比,2507 版本在知识覆盖、长上下文推理、代码基准测试以及面向开放式任务的对齐方面带来显著提升。在多语言理解、数学推理(例如 AIME、HMMT)以及对齐评估(如 Arena-Hard 和 WritingBench)上表现尤其强劲。
文本生成
输入:¥ 0.00125 / 千 tokens
输出:¥ 0.0075 / 千 tokens
通义千问 Qwen-Turbo
Qwen3系列Turbo模型,实现思考模式和非思考模式的有效融合,可在对话中切换模式。推理能力以更小参数规模比肩QwQ-32B、通用能力显著超过Qwen2.5-Turbo,达到同规模业界SOTA水平。
文本生成
输入:¥ 0.0003 / 千 tokens
输出:¥ 0.002 / 千 tokens
Kimi K2
Kimi K2 Instruct 是由 Moonshot AI 开发的大规模专家混合(Mixture-of-Experts,MoE)语言模型,总参数量达 1 万亿,每次前向计算活跃参数为 320 亿。该模型针对智能体(agentic)能力进行了优化,包括高级工具使用、推理与代码合成。Kimi K2 在广泛的基准测试中表现优异,尤其在编码(LiveCodeBench、SWE-bench)、推理(ZebraLogic、GPQA)和工具使用(Tau2、AceBench) 任务上表现突出。Kimi K2 支持最长 128 K tokens 的长上下文推理,并采用了一套新颖的训练栈,其中包含用于稳定大规模 MoE 训练的 MuonClip 优化器。
文本生成
输入:¥ 0.0065 / 千 tokens
输出:¥ 0.025 / 千 tokens
Hunyuan A13B Instruct
混元-A13B是由腾讯开发的130亿激活参数的专家混合模型,总参数量达800亿,支持通过思维链进行推理。该模型在数学、科学、编程及多轮推理任务中展现出具有竞争力的基准性能,同时通过分组查询注意力技术及量化支持(FP8、GPTQ等)保持高效推理效率。
文本生成
输入:¥ 0.0019 / 千 tokens
输出:¥ 0.0075 / 千 tokens
Baidu ERNIE 4.5 300B A47B
ERNIE-4.5-300B-A47B是百度ERNIE 4.5系列推出的3000亿参数专家混合语言模型,每token激活470亿参数,支持中英文文本生成。该模型采用异构MoE架构与先进路由策略,结合FP8及2比特等量化技术,针对高吞吐量推理与高效扩展进行优化。本版本专精纯语言任务,支持逻辑推理、工具参数调用,并具备13.1万token的超长上下文处理能力,适用于需要高水平推理能力与高吞吐性能的通用大语言模型应用场景。
文本生成
输入:¥ 0.00375 / 千 tokens
输出:¥ 0.01375 / 千 tokens
ERNIE 4.5 VL 424B A47B
ERNIE-4.5-VL-424B-A47B是百度ERNIE 4.5系列的多模态专家混合模型,总参数量达4240亿,每token激活470亿参数。该模型采用异构MoE架构与模态隔离路由机制,通过文本与图像的联合训练,实现了高保真跨模态推理、图像理解及长上下文生成(最高支持13.1万token)。结合SFT、DPO、UPO和RLVR等技术进行微调,支持思维与非思维推理模式。专为中英文视觉语言任务设计,具备高效扩展特性,可在4比特/8比特量化环境下运行。
图片识别
输入:¥ 0.006 / 千 tokens
输出:¥ 0.0175 / 千 tokens
Hunyuan a13b
腾讯混元A13B是一款基于细粒度混合专家(MoE)架构的创新开源大语言模型。该模型专为高效与可扩展性而设计,能够以较低的计算开销实现前沿性能,使其成为高级推理与通用应用的理想选择,尤其在资源受限的环境中表现出色。
文本生成
输入:¥ 0.0006 / 千 tokens
输出:¥ 0.0025 / 千 tokens
Hunyuan-T1-Vision 视觉深度思考大模型
混元多模态理解深度思考模型,支持多模态原生长思维链,擅长处理各种图片推理场景,在理科难题上相比快思考模型全面提升。
图片理解、深度思考
输入:¥ 0.0035 / 千 tokens
输出:¥ 0.01015 / 千 tokens