筛选
模型列表
共 180 个模型
Qwen3 VL 8B Instruct
Qwen3-VL-8B-Instruct 是来自 Qwen3-VL 系列的多模态视觉-语言模型,目标在对文本、图像与视频实现高保真理解与推理。它采用了改进的多模态融合机制——Interleaved-MRoPE,用于长时跨度的时间推理;引入 DeepStack 实现细粒度的视觉—文本对齐;并支持文本—时间戳对齐以实现精确的事件定位。Qwen3-VL-8B-Instruct 模型原生支持 256K tokens 的上下文窗口,可扩展至 1M tokens,能够处理静态与动态媒体输入,适用于文档解析、视觉问答、空间推理与图形界面(GUI)控制等任务。它在文本理解方面达到了与领先大型语言模型相当的水平,同时将 OCR 覆盖扩展到 32 种语言,并在多种视觉条件下增强了稳健性。
图片识别
输入:¥ 0.001 / 千 tokens
输出:¥ 0.00275 / 千 tokens
Qwen3 VL 8B Thinking
Qwen3-VL-8B-Thinking 是 Qwen3-VL-8B 多模态模型的推理优化版本,专为处理复杂场景、文档及时间序列的高级视觉与文本推理而设计。该模型集成了增强的多模态对齐能力和长上下文处理技术(原生支持 256K tokens,可扩展至 100 万 tokens),适用于科学视觉分析、因果推理以及基于图像或视频输入的数学推理等任务。
图片识别、深度思考
输入:¥ 0.0023 / 千 tokens
输出:¥ 0.025 / 千 tokens
Qwen3 VL 30B A3B Instruct
Qwen3-VL-30B-A3B-Instruct 是一款多模态模型,深度融合强大的文本生成能力与图像、视频的视觉理解功能。其指令优化版本针对通用多模态任务的指令遵循能力进行了专项优化。该模型在现实世界与合成场景的视觉感知、二维/三维空间定位、长篇幅视觉内容理解方面表现卓越,在多模态基准测试中取得领先成绩。针对智能体应用场景,它能处理多图像多轮指令交互、视频时间轴对齐、图形界面自动化任务,以及从草图到调试完成的视觉编程全流程。文本性能与旗舰版Qwen3系列持平,适用于文档智能处理、光学字符识别、界面操作辅助、空间任务及智能体研究等领域。
图片识别
输入:¥ 0.004 / 千 tokens
输出:¥ 0.0125 / 千 tokens
Qwen3 VL 30B A3B Thinking
Qwen3-VL-30B-A3B-Thinking 是一款多模态模型,深度融合强大的文本生成能力与图像、视频的视觉理解功能。其思维增强版本显著提升了在STEM领域、数学及复杂任务中的推理能力。该模型在现实世界与合成场景的视觉感知、二维/三维空间定位、长篇幅视觉内容理解方面表现卓越,在多模态基准测试中取得领先成绩。针对智能体应用场景,它能处理多图像多轮指令交互、视频时间轴对齐、图形界面自动化任务,以及从草图到调试完成的视觉编程全流程。文本性能与旗舰版Qwen3系列持平,适用于文档智能处理、光学字符识别、界面操作辅助、空间任务及智能体研究等领域。
图片识别、深度思考
输入:¥ 0.004 / 千 tokens
输出:¥ 0.0125 / 千 tokens
GLM 4.6
与 GLM-4.5 相比,GLM-4.6 模型实现了多项关键改进:更长的上下文窗口:上下文窗口从 128K 字符扩展至 200K 字符,使模型能够处理更复杂的智能体任务。卓越的编程性能:在代码基准测试中获得更高分数,并在 Claude Code、Cline、Roo Code 及 Kilo Code 等实际应用中表现更佳,包括生成视觉效果更佳的前端页面方面有所提升。进阶推理能力:GLM-4.6 在推理性能上显著提升,并支持推理过程中的工具调用,从而形成更强大的综合能力。更强大的智能体:GLM-4.6 在工具调用和基于搜索的智能体方面表现更出色,并能更高效地集成至智能体框架中。精细化写作:更符合人类对文风与可读性的偏好,在角色扮演场景中的表现也更为自然。
文本生成、深度思考
输入:¥ 0.0075 / 千 tokens
输出:¥ 0.021 / 千 tokens
DeepSeek V3.2 Exp
DeepSeek-V3.2-Exp 是由 DeepSeek 发布的实验性(Experimental)大语言模型,作为V3.1与未来架构之间的中间版本。该模型引入了 DeepSeek 稀疏注意力(DSA)机制——一种细粒度稀疏注意力架构,旨在保持输出质量的同时提升长上下文场景下的训练与推理效率。用户可通过 "reasoning": {"enabled": true} 布尔参数控制推理行为。模型的训练条件与 DeepSeek-V3.1-Terminus 保持一致,以实现直接性能对比。基准测试显示,该模型在推理、代码生成和智能体工具使用任务上的表现与 V3.1 大致持平,不同领域存在微幅的性能取舍与提升。本次发布侧重于验证针对长上下文优化的架构设计,而非追求原始任务精度的突破,因此本质上属于研究导向型模型,主要用于探索高效的 Transformer 架构设计。
文本生成
输入:¥ 0.0035 / 千 tokens
输出:¥ 0.0055 / 千 tokens
Baidu ERNIE X1.1
Baidu ERNIE X1.1 模型在问答、工具调用、智能体、指令遵循、逻辑推理、数学、代码任务的效果显著提升,事实性显著提升;X1.1 模型上下文长度扩展到 64K tokens,支持更长的输入与对话历史,在保持响应速度的同时,提高了长链路推理的连贯性。
文本生成
输入:¥ 0.0012 / 千 tokens
输出:¥ 0.0045 / 千 tokens
Qwen3 VL 235B A22B Instruct
Qwen3-VL-235B-A22B Instruct 是一款开放参数的多模态模型,融合了强大的文本生成能力与跨图像、视频的视觉理解功能。该指令调优模型专注于通用视觉语言任务(视觉问答、文档解析、图表/表格提取、多语言OCR)。该系列模型重点强化了鲁棒感知(识别多样化的真实世界及合成类别)、空间理解(2D/3D定位)以及长篇幅视觉内容解析能力,在公开多模态基准测试的感知与推理任务中均展现出卓越表现。除分析功能外,Qwen3-VL 还支持智能体交互与工具调用:可遵循跨多图像、多轮对话的复杂指令;将文本与视频时间轴对齐以实现精准的时间定位查询;操作图形界面元素完成自动化任务。该模型还能驱动可视化编程工作流——将草图或原型转化为代码并辅助UI调试,同时保持与旗舰版Qwen3语言模型相媲美的纯文本处理性能。这些特性使 Qwen3-VL 适用于文档AI、多语言OCR、软件/UI辅助、空间/具身任务以及视觉语言智能体研究等多元化生产场景。
图片识别
输入:¥ 0.004 / 千 tokens
输出:¥ 0.022 / 千 tokens
Qwen3 VL 235B A22B Thinking
Qwen3-VL-235B-A22B Thinking 是一款多模态模型,融合了强大的文本生成能力与跨图像、视频的视觉理解功能。该模型专门针对 STEM 领域和数学的多模态推理进行优化,重点强化了鲁棒感知(识别多样化的真实世界及合成类别)、空间理解(2D/3D定位)以及长篇幅视觉内容解析能力,在公开多模态基准测试的感知与推理任务中均展现出卓越表现。除分析功能外,Qwen3-VL 还支持智能体交互与工具调用:可遵循跨多图像、多轮对话的复杂指令;将文本与视频时间轴对齐以实现精准的时间定位查询;操作图形界面元素完成自动化任务。该系列模型还能驱动可视化编程工作流,将草图或原型转化为代码并辅助UI调试,同时保持与旗舰版Qwen3语言模型相媲美的纯文本处理性能。这些特性使 Qwen3-VL 适用于文档AI、多语言OCR、软件/UI辅助、空间/具身任务以及视觉语言智能体研究等多元化生产场景。
图片识别
输入:¥ 0.004 / 千 tokens
输出:¥ 0.036 / 千 tokens
DeepSeek V3.1 Terminus
DeepSeek-V3.1 Terminus 是 DeepSeek V3.1 的升级版本,在保留模型原有能力的基础上,针对用户反馈的语言一致性和智能体能力等问题进行了优化,进一步提升了模型在编程和搜索智能体场景下的表现。该模型是大型混合推理模型(参数总量6710亿,激活参数370亿),支持思考与非思考两种模式。它通过两阶段长上下文训练流程扩展了 DeepSeek-V3 的基础能力,上下文长度最高可达128K词元,并采用FP8微缩放技术实现高效推理。用户可通过 {"reasoning": {"enabled": true}} 布尔参数控制推理行为。该模型优化了工具调用、代码生成和推理效率,在困难基准测试中达到与 DeepSeek-R1 相当的性能,同时响应速度更快。它支持结构化工具调用、代码智能体与搜索智能体,适用于研究、编程和智能体工作流等场景。
文本生成
输入:¥ 0.00375 / 千 tokens
输出:¥ 0.0125 / 千 tokens
Qwen3 Coder Plus
Qwen3 Coder Plus 是基于 Qwen3 的代码生成模型,具有强大的 Coding Agent 能力,擅长工具调用和环境交互,能够实现自主编程、代码能力卓越的同时兼具通用能力。
文本生成、代码补全
通义千问 Qwen3 Max
Qwen3 Max 是通义千问 3 系列 Max 模型,相较 preview 版本在智能体编程与工具调用方向进行了专项升级。本次发布的正式版模型达到领域 SOTA 水平,适配场景更加复杂的智能体需求。
文本生成、深度思考
Tongyi DeepResearch 30B A3B
通义深度研究(Tongyi DeepResearch)是由通义实验室开发的智能体大型语言模型,总参数量达300亿但每词元仅激活30亿参数。该模型专为长周期深度信息检索任务优化,在Humanity's Last Exam、BrowserComp、BrowserComp-ZH、WebWalkerQA、GAIA、xbench-DeepSearch及FRAMES等基准测试中均达到顶尖水平。相较于先前模型,它在复杂智能搜索、推理和多步骤问题解决方面表现更为卓越。模型采用全自动合成数据管道,支持可扩展的预训练、微调与强化学习。通过对多样化智能体数据进行大规模持续预训练,持续增强推理能力并保持知识新鲜度。其特色包括端到端同策略强化学习框架,配备定制化的组相对策略优化机制——包含词元级梯度计算与负样本过滤技术以确保训练稳定性。模型支持ReAct框架进行核心能力验证,并提供基于迭代研究(IterResearch)的"重型"模式,通过测试时扩展实现极致性能。特别适用于高级研究智能体、工具调用及复杂推理工作流场景。
文本生成、深度研究
输入:¥ 0.00125 / 千 tokens
输出:¥ 0.0055 / 千 tokens
Qwen3 Next 80B A3B Instruct
Qwen3-Next-80B-A3B-Instruct 是 Qwen3-Next 系列中经过指令微调的对话模型,专为快速稳定的响应而优化,不输出"思维"轨迹。该模型面向推理、代码生成、知识问答和多语言应用等复杂任务,同时在对齐能力和格式规范性方面保持稳健表现。相较此前 Qwen3 指令微调版本,其重点提升了超长输入和多轮对话下的吞吐量与稳定性,特别适合需要最终答案一致性而非显式思维链的 RAG、工具调用及智能体工作流程。该模型采用扩展高效训练与解码技术,显著提升参数效率与推理速度,并在广泛公开基准测试中验证了其性能——在多个类别达到或接近更大规模 Qwen3 系统的水平,同时超越早先的中等规模基线模型。作为通用助手、编程协作者和长上下文任务处理工具,它最适用于生产环境中需要确定性指令跟随输出的场景。
文本生成
输入:¥ 0.00175 / 千 tokens
输出:¥ 0.0175 / 千 tokens
Qwen3 Next 80B A3B Thinking
Qwen3-Next-80B-A3B-Thining 是 Qwen3-Next 系列中优先推理的对话模型,默认输出结构化的"思维"轨迹。该模型专为复杂多步骤问题设计,涵盖数学证明、代码合成/调试、逻辑推理和智能体规划等领域,在知识理解、推理能力、编程实践、对齐性能及多语言评估中均表现卓越。相比此前Qwen3系列版本,该模型显著提升了长链思维下的稳定性与推理时的高效扩展性,经过调优后能够遵循复杂指令,同时减少重复性或偏离任务的行为。该模型适用于智能体框架与工具调用(函数调用)、高频率检索的工作流程,以及需要分步解决方案的标准化基准测试。它支持生成长篇详细的内容完成结果,并采用面向吞吐量的技术(如多令牌预测)以加速生成过程。需注意该模型仅运行在纯思维模式下。
文本生成、深度思考
输入:¥ 0.00175 / 千 tokens
输出:¥ 0.0175 / 千 tokens
通义千问 Qwen VL Plus
通义千问VL-Plus(qwen-vl-plus),即通义千问大规模视觉语言模型增强版。大幅提升细节识别能力和文字识别能力,支持超百万像素分辨率和任意长宽比规格的图像。在广泛的视觉任务上提供卓越的性能。
图片理解
输入:¥ 0.001 / 千 tokens
输出:¥ 0.00225 / 千 tokens
Kimi K2 0905
Kimi K2 0905 是Kimi K2 0711的九月更新版。该模型由月之暗面(Moonshot AI)研发,是采用专家混合架构(MoE)的超大规模语言模型,总参数量达万亿规模,前向推理激活参数量为 320 亿。其上下文窗口长度从之前的 128K 扩展至 256K tokens,支持长上下文推理。本次更新显著提升了智能体编码能力,在各类编程框架中展现出更高准确性和更强泛化能力;同时增强了前端编程表现,能为网页、3D等任务生成兼具美学价值与功能性的代码。Kimi K2 专门针对智能体能力进行优化,涵盖高级工具使用、复杂推理和代码合成三大核心领域,在编程(LiveCodeBench、SWE-bench)、推理(ZebraLogic、GPQA)和工具使用(Tau2、AceBench)等基准测试中均表现卓越。该模型采用创新训练框架,集成MuonClip优化器,确保超大规模MoE模型的稳定训练。
文本生成
输入:¥ 0.00625 / 千 tokens
输出:¥ 0.025 / 千 tokens
Baidu ERNIE 4.5 Turbo 128K
文心 4.5 Turbo 在去幻觉、逻辑推理和代码能力等方面也有着明显增强。模型能力均衡,支持 128K 上下文长度,可以很好满足多轮长历史对话处理、长文档理解问答任务。
文本生成
输入:¥ 0.001 / 千 tokens
输出:¥ 0.0035 / 千 tokens
Qwen3 30B A3B Thinking 2507
Qwen3-30B-A3B-Thinking-2507 是一款拥有300亿参数的专家混合推理模型,专门针对需要多步骤深度思考的复杂任务进行优化。该模型专为"思维模式"设计,其核心特性是将内部推理过程与最终答案分离。相较于早期发布的 Qwen3-30B 版本,本模型在逻辑推理、数理科学、编程开发及多语言基准测试方面均实现性能提升,同时展现出更强的指令遵循能力、工具使用能力以及与人类价值观的对齐能力。凭借更高的推理效率和扩展的输出容量,该模型特别适用于前沿学术研究、竞技级问题求解,以及需要结构化长上下文推理的智能体应用场景。
文本生成
输入:¥ 0.00125 / 千 tokens
输出:¥ 0.00375 / 千 tokens
DeepSeek V3.1
DeepSeek V3.1 是一个大型混合推理模型(6710 亿参数,其中 370 亿为活跃参数),通过提示模板支持带“thinking”(思考)和非思考两种模式。DeepSeek V3.1 在 V3 的基础上进行了扩展,采用双阶段长上下文训练流程,最大支持 128 K tokens,并使用 FP8 微缩放以提高推理效率。模型可以通过 `"reasoning": {"enabled": true}` 参数来控制推理行为。 DeepSeek V3.1 改进了工具使用、代码生成和推理效率,在一些基准测试上可达到与 DeepSeek R1 相当的性能,同时响应更快。DeepSeek V3.1 支持结构化工具调用、代码代理与搜索代理,适用于科研、编写代码和智能体工作流。
文本生成
输入:¥ 0.0035 / 千 tokens
输出:¥ 0.0125 / 千 tokens