主流厂商全线接入,海量大模型任你选,用 AI 就这么简单

DeepSeekDeepSeek V4.1-Flash为552B参数MoE模型,采用非对称编码器-解码器架构,输入激活8B输出激活16B,原生多模态视觉理解,KV缓存压缩至前代1/4,开源超越V4-Pro。
通义千问为多模态Agent应用提供核心引擎,Qwen3-Omni-30B-A3B。Qwen3-Omni-30B-A3B是千问的端侧全模态模型,以极低推理成本支持文本、图像和音频处理。
蚂蚁百灵Ling-3.0-flash-VL为124B参数MoE多模态模型,单次推理激活5.5B,原生支持图文视频输入,引入观察-行动-验证-修正视觉反馈闭环,256K上下文,MIT协议开源。
Google DeepMindGoogle DeepMind Gemini 3.8 Flash Cyber于2026年9月2日发布,与Gemini 3.8 Flash共享基础智能但采用更宽松的网络安全缓解措施,专为网络安全防御者设计,仅通过Fairwind Program向政府机构、关键基础设施运营商、软件维护商等受信任防御者开放。
Yutori Navigator n2是2026年8月26日发布的270亿参数电脑操作模型,可在Linux、macOS与Windows桌面环境中交替使用图形界面、命令行与代码完成任务
CohereCohere Parse 5是2026年8月27日发布的23亿参数视觉语言模型,专注把PDF、幻灯片与图像等企业文档转换为结构化Markdown,API按每千页1.5美元计费
智谱AI智谱AIGLM-5.3-Flash是2026年8月26日开源的GLM-5系列首批原生多模态模型,总参数320B激活18B,MIT协议开源,全部线上推理由国产芯片集群承载
通义千问通义千问Qwen3.8-Flash是2026年8月26日开源的多模态MoE模型,主模型125B参数每token仅激活6B,原生262144上下文可扩展至100万,训练成本约为前代的九分之一
DeepSeekDeepSeek V4-Flash-Vision-Exp是深度求索于2026年8月21日宣布上线的多模态视觉理解实验模型,在DeepSeek API平台开启多模态API服务。
Meta AIMuse Glimmer 30B是Meta超级智能实验室(MSL)于2026年8月10日发布并开源的多模态Agent模型,标志着Meta在春季退役Llama开源线、转向闭源Muse Spark后,重新回归开源
Mistral AIShieldstral是Mistral AI于2026年8月4日正式发布的3B参数开放权重多模态安全分类器,代表了内容审核领域的一次范式重构。与传统依赖固定风险标签的安全模型不同,Shieldstral支持在推理阶段通过自然语言输入自定义审核规则,使同一模型可适配不同业务场景。
豆包大模型豆包大模型SeedRealtime于2026年8月5日发布,是字节跳动推出的原生音视频全双工大模型,采用统一端到端架构融合音频、视频与文本,实现边看、边听、边说的实时交互体验,已在豆包App全量上线。
Google DeepMindGemini Robotics ER 2是Google DeepMind于2026年7月30日发布公开预览的具身推理Embodied Reasoning模型,专为机器人应用场景设计。该模型提供两个端点:gemini-robotics-er-2-preview和gemini-robotics-er-2-streaming-preview,分别面向标准推理和实时流式场景。
Google DeepMindGemini 3.6 Flash是Google DeepMind于2026年7月21日正式发布的稳定版Gemini API模型,隶属Gemini 3.6系列。该模型在Gemini 3.5 Flash基础上迭代,重点强化代码生成、多模态理解与知识工作三大能力
MiniMax2026年WAIC上MiniMax首发M3.1升级版本MiniMax-M3.1,428B总参数激活23B的MoE架构搭配自研MSA稀疏注意力,1M上下文适配工业制造与供应链协同等复杂商业场景。
Mistral AIMistral AI Robostral Navigate是2026年7月8日发布的8B具身导航模型,仅需单个RGB摄像头即可实现全自主导航,在R2R-CE未见场景成功率76.6%,超越多传感器方案。
Meta AIMuse Spark 1.1是Meta超级智能实验室于2026年7月9日正式发布的多模态推理模型,定位为面向智能体任务的前沿模型。该模型在工具调用、计算机操作、编程和多模态理解方面实现重大提升,是Meta在AI Agent赛道的重要布局。
通义千问通义千问Qwen3.5-Omni-Plus是2026年3月发布的旗舰级原生全模态大模型,支持图片、视频、语音、文字全模态输入输出,256K上下文,113种语言,在215项第三方评测中取得SOTA。
通义千问通义千问Qwen3.5-Omni-Plus-Realtime是全模态大模型的实时版本,支持端到端语音对话,无需分别调用ASR和TTS,适合实时交互场景。
面壁智能ModelBest面壁智能ModelBest MiniCPM-V是多模态视觉语言模型,具备图文理解与图像描述生成能力,可应用于智能客服、内容审核和多模态搜索等场景。