筛选
模型列表
共 180 个模型
LongCat 2.0
LongCat 2.0 是美团 LongCat AI 推出的新一代万亿参数的混合专家(MoE)大语言模型,此模型专为 **Agentic Coding(智能体编程)** 场景设计,在上下文长度、专家融合架构以及国产算力适配上带来了多项行业突破。
文本生成、深度思考
输入:¥ 0.0025 / 千 tokens
输出:¥ 0.0085 / 千 tokens
Qwen Image 2.0
Qwen-Image-2.0 是通义千问推出的新一代多模态图像生成基础模型。该模型最大的突破在于将“图像生成”与“图像编辑”两条技术路径完美融为一体。它在架构上耦合了 Qwen3-VL 作为条件编码器(Condition Encoder),并搭配多模态扩散 Transformer(Multimodal Diffusion Transformer, MDT)进行联合建模,实现了从理解、生成到编辑的一体化。
图片生成
价格: ¥ 0.23 / 张
Qwen Image 2.0 Pro
Qwen-Image-2.0-Pro 是通义千问推出的专业级图像生成大模型。该模型基于先进的 **MMDiT(Multi-modal Diffusion Transformer)** 架构,拥有约 20B(200亿)的参数量。它主打高精度、商业级和强可控性的文生图与图生图能力,尤其在中文语境理解和复杂排版上表现优异。
图片生成
价格: ¥ 0.55 / 张
Doubao Seedream 5.0 Lite
Doubao Seedream 5.0 Lite(豆包图像创作模型 5.0 Lite)是字节跳动推出的一款专业级图像创作与多模态创意模型。作为 Seedream 系列的最新轻量化(Lite)迭代版本,它不仅在画面表现上继承了豆包一贯的高水准,更在实时检索、跨模态推理及一致性上实现了跨越式的升级。
图片生成
价格: ¥ 0.25 / 张
CosyVoice V3 Plus
CosyVoice V3 Plus 是通义实验室推出的最新一代生成式语音合成(TTS)大模型。该模型代表了目前 CosyVoice 系列中合成效果最佳、综合能力最强的旗舰版本。
语音合成
价格:¥ 0.25 / 千字符
GLM Image
GLM-Image 是智谱新旗舰图像生成模型, 模型全程基于国产芯片完成训练,采用独创的「自回归+扩散解码器」混合架构,兼顾全局指令理解与局部细节刻画,克服了海报、PPT、科普图等知识密集型场景生成难题,是面向以 Nano Banana Pro 为代表的新一代「认知型生成」技术范式的一次重要探索。
图片生成
价格: ¥ 0.12 / 张
CosyVoice V3 Flash
CosyVoice V3 Flash 是阿里巴巴通义实验室(FunAudioLLM 团队)推出的新一代轻量级、超低延迟的大语言模型语音合成(TTS)与声音克隆模型。作为 CosyVoice 3.0 家族中的重要一员,“Flash” 版本核心主打极致的响应速度(低延迟)与高性价比的商业化落地。
语音合成
价格:¥ 0.15 / 千字符
Qwen3 ASR Flash
Qwen3-ASR-Flash 是阿里巴巴通义千问团队推出的一款高性能语音识别(ASR,Automatic Speech Recognition)模型服务。它基于强大的 Qwen3-Omni 多模态大模型底座,并经过了数千万小时多模态语音数据的精细训练,旨在提供极其快速、精准且具备大模型理解能力的语音转文字体验。
语音识别
价格:¥ 0.02 / 分钟
Fun ASR Flash
Fun-ASR-Flash 是阿里巴巴通义实验室推出的工业级端到端语音识别(ASR)大模型,全面支持汉语传统七大方言体系(官话/吴/湘/赣/客/闽/粤),并适配 20+ 地区口音官话。针对中文古诗词的韵律、节奏与文言表达特点进行专项优化,提升对古诗词内容的识别准确率,适用于文化传承、教育讲解、有声读物等场景。
语音识别、方言识别
价格:¥ 0.02 / 分钟
GLM TTS
GLM-TTS 是一款以新一代智谱语音大模型为核心的语音合成(TTS)大模型,突破了传统的语音合成框架,通过上下文智能预判文本情绪与语调,显著提升语音自然度与表现力,让合成语音具备真实情感与生命力。
语音合成
价格:¥ 0.25 / 千字符
GLM ASR 2512
GLM-ASR-2512 是由智谱 AI 推出新一代语音识别模型,支持音频转文字、中英混合及多国语言,精通粤语/四川话等方言;具备自定义词典功能,完美适配会议纪要、客服质检、医疗病历及游戏语音等复杂场景,提供高效精准的流式转录服务。
语音识别
价格:¥ 0.015 / 分钟
Doubao Seed Evolving
Doubao Seed Evolving 是面向 Agent 与 Coding 场景打造的 Seed 系列模型,具备复杂任务编排、长程规划、代码生成与工具调用能力。统一调用 Model ID 为 doubao-seed-evolving,无需关注版本切换,即可持续获得最新模型能力。
多模态、深度思考、视觉理解
输入:¥ 0.0065 / 千 tokens
输出:¥ 0.032 / 千 tokens
GLM 5.2
GLM-5.2 是智谱面向长程任务时代的旗舰模型。凭借真正可用的 100 万 tokens 上下文窗口,它能够处理项目级工程上下文,更可靠地执行长时间运行的任务,更一致地遵循工程标准,并在单个任务中完成从需求到多平台部署的完整开发工作流。
深度思考、长任务能力
输入:¥ 0.009 / 千 tokens
输出:¥ 0.03 / 千 tokens
Doubao Seed Character
Doubao Seed Character 是面向新一代虚拟陪伴场景打造的 Seed 分支模型,擅长虚拟演绎与“真人”风格的角色扮演,支持剧情创作、剧情演绎与推动、多人聊天等多类对话互动场景。模型在角色理解、人设保持、多轮对话、剧情推进与互动表达上持续增强,能够稳定理解用户意图、延续角色设定,并以更具画面感的语言带来自然、生动、连贯的互动体验。
角色扮演、剧情演绎、文本生成
Doubao Seed 2.1 Turbo
Doubao Seed 2.1 Turbo 是字节跳动推出的面向 Coding 和 Agent 时代打造的新一代大模型,全面升级 Coding、Agent 与多模态能力,Turbo 版本针对规模化生产的低成本、低延迟版本,效果接近 Pro,更适合企业高并发部署。
多模态、深度思考、视觉理解
输入:¥ 0.0032 / 千 tokens
输出:¥ 0.0165 / 千 tokens
Doubao Seed 2.1 Pro
Doubao Seed 2.1 Pro 是字节跳动推出的面向 Coding 和 Agent 时代打造的新一代大模型,全面升级 Coding、Agent 与多模态能力,以更强的自主规划、长链路执行和动态修复能力,胜任企业真实复杂任务。
多模态、深度思考、图片理解
输入:¥ 0.0065 / 千 tokens
输出:¥ 0.032 / 千 tokens
Kimi K2.7 Code
Kimi K2.7 Code 是一款基于 Kimi K2.6 构建、专注于编码的智能体模型。它在真实世界的长周期编码任务上实现了显著改进,增强了跨复杂软件工程工作流的端到端任务完成能力,同时提升了 token 效率,与 Kimi K2.6 相比,思考 token 的使用量减少了约 30%。
代码补全、编程工具
输入:¥ 0.007 / 千 tokens
输出:¥ 0.028 / 千 tokens
Qwen3.7 Plus
Qwen3.7 Plus 是 Qwen3.7 系列中高性价比 Plus 模型,在强大文本能力的基础上全面升级了视觉-语言能力,同时保持了在编码、工具使用和生产力工作流方面的完整智能体能力。其核心特色为多模态交互混合智能体能力,能够感知真实世界场景、读取屏幕并操作 GUI、基于视觉参考生成代码、端到端导航移动应用。
文本生成、深度思考、视觉理解
MiniMax M3
MiniMax M3 凭借业界领先的 Coding 与 Agentic 能力、1M 超长上下文窗口以及原生多模态特性,可出色胜任企业级长文档理解、高质量内容生成、代码编写、Bug 修复及原生应用构建等任务;强大的 Agentic 能力端到端贯通工作流,原生多模态更带来流畅自然的图文混合交互体验。
文本生成、深度思考、专业能力
输入:¥ 0.005 / 千 tokens
输出:¥ 0.019 / 千 tokens
Qwen3.7 Max
Qwen3.7 Max 是 Qwen3.7 系列中规模最大、综合能力最强的 Max 模型,当前开放纯文本模型能力供体验。Qwen3.7 是面向智能体时代的新一代旗舰模型,核心优势在于智能体能力的广度与深度:在编程、办公与生产力、长周期自主执行方面均能出色胜任各项任务。
文本生成、深度思考
输入:¥ 0.0129 / 千 tokens
输出:¥ 0.0385 / 千 tokens