-
小米发布并开源 MiMo-V2.6:扩展强化学习规模,增强全模态 Agent 能力
小米正式发布并开源 Xiaomi MiMo-V2.6 系列,包含 Pro 和 Flash 两个原生全模态模型。新模型通过扩大强化学习算力与复杂任务规模,重点提升软件工程、计算机操作、视觉推理、3D 世界构建和科研辅助能力,同时开放模型权重、技术报告、RL 训练框架及7000余个任务环境。- 916
- 0
-
GLM-5.3-FlashX:智谱基于 GLM-5.3-Flash 推出的高速推理模型
GLM-5.3-FlashX 是智谱面向开发者和企业推出的 GLM-5.3-Flash 高速推理版本,最高输出速度可达 200 tokens/s。模型延续 GLM-5.3-Flash 的 Coding、Agent、视觉理解及专业办公能力,并通过 Infra 和推理侧优化提升生成速度,适合对实时响应和高频调用要求较高的应用。- 398
- 0
-
Google 发布 Gemini 3.8 Live,实时语音 AI 可边对话边推理
Google 正式发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款实时语音模型,分别面向低延迟语音交互和复杂多步骤语音 Agent 场景。新模型支持实时视觉理解、多语言切换、工具调用,其中 Extended Thinking 可在保持语音交流的同时进行后台推理和异步任务执行。- 1.4k
- 0
-
Gemini 3.8 Live - Google 推出的新一代实时多模态语音模型
Gemini 3.8 Live 是 Google 推出的实时音频对音频模型,面向语音智能体与实时对话场景,支持视觉理解、97 种语言自动切换、异步工具调用和实时多模态交互;同时推出 Extended Thinking 版本,为复杂任务提供后台持续推理与多步骤执行能力。- 292
- 0
-
DeepSeek V4.1 Flash正式发布:原生支持多模态,API 成本进一步降低
DeepSeek 正式发布 V4.1 Flash 模型,采用全新的非对称 Causal-Encoder-Decoder 架构,总参数量为 552B,输入激活 8B、输出激活 16B。新模型原生支持视觉理解,并通过压缩 KV Cache、优化推理效率和下调 API 价格,进一步降低 AI Agent、编程及长上下文任务的使用成本。- 5k
- 0
-
OpenAI发布GPT-Image-2.5:双型号上线,强化图像生成与精准编辑
2026年09月09日,OpenAI 正式发布 ChatGPT Images 2.5,并向开发者推出 GPT-Image-2.5 Flare 和 GPT-Image-2.5 Sunburst 两款 API 模型,重点提升图像质量、生成速度和编辑控制能力。 新模型改善了自然光照、纹理与画面细节,能够更准确地保留参考图片中的人物和物品。在局部修改和多轮编辑中,模型更可靠地遵循指令,减少对其他画面元素的…- 1.4k
- 0
-
GPT-Image-2.5 - OpenAI推出的图像生成与精准编辑模型
GPT-Image-2.5 是 OpenAI 推出的图像生成与编辑模型系列,包含主打快速生成的 Flare 和侧重精细编辑的 Sunburst。支持文字生图、参考图生成、局部修改、多轮编辑及透明背景,适用于内容配图、商品展示、广告设计和图像应用开发。- 396
- 0
-
OpenAI发布GPT-6 Astra:面向复杂端到端任务的新一代旗舰模型
OpenAI正式发布旗舰模型GPT-6 Astra,重点强化计算机与浏览器操作、软件工程、科学推理和专业办公能力。该模型支持105万tokens上下文,将分批向ChatGPT付费用户、OpenAI API及Amazon Bedrock开放。- 4.8k
- 0
-
GPT-6 Astra - OpenAI 推出的新一代旗舰大模型
GPT-6 Astra 是 OpenAI 面向复杂端到端任务推出的旗舰推理模型,重点强化计算机与浏览器操作、软件工程、科学研究和专业办公,可在长流程中调用工具并生成文档、表格、演示文稿等成品,适合开发者、研究人员及企业知识工作者。- 876
- 0
-
Gemini 3.8 Flash - Google 推出的新一代高效多模态模型
Gemini 3.8 Flash 是 Google 推出的新一代高效多模态模型,重点提升长程软件工程、自主智能体、工具调用和复杂专业推理能力,并支持百万级上下文。同期推出的 Flash Cyber 专注漏洞发现与自动修复,目前仅通过 Fairwind Program 向可信网络安全机构开放。- 420
- 0
-
DeepSeek-V4-Flash-Vision-Exp开放模型权重,采用MIT协议开源
DeepSeek正式开放DeepSeek-V4-Flash-Vision-Exp模型权重及参考推理代码,采用MIT协议,支持多模态Agent研究、私有化部署与二次开发。- 1.8k
- 0
-
阿里发布Qwen3.8-Flash:新架构降低训练成本,API输入每百万Tokens仅1元
8月26日晚,阿里通义千问团队正式发布全新多模态 MoE 模型 Qwen3.8-Flash。该模型主模型参数量为 125B,额外配备 51B N-gram Embedding,每 Token 仅激活 6B 参数,原生支持 262,144 Tokens 上下文,并可通过 YaRN 扩展至100万 Tokens。 Qwen3.8-Flash 围绕 Attention、Residual、Embeddin…- 2.8k
- 0
-
Qwen3.8-Flash:阿里通义千问最新推出的多模态大模型
Qwen3.8-Flash-Next 是阿里通义千问推出的开放权重多模态 MoE 模型,预览 Qwen4 架构,支持编程、办公智能体、图像视频理解及百万级上下文。- 1.2k
- 0
-
智谱发布 GLM-5.3-Flash:GLM-5 系列首款原生多模态模型
2026年08月26日,智谱 AI 正式发布 GLM-5.3-Flash,也就是此前受到行业关注的“ox-alpha”。这是 GLM-5 系列首款原生多模态模型,面向 Coding、Agent 和专业生产力任务,在保持较强模型能力的同时,进一步降低推理与使用成本。 GLM-5.3-Flash 采用 320B 总参数、18B 激活参数的 MoE 架构,并在 GLM 系列中首次结合稀疏注意力与线性注意…- 3.6k
- 0
-
GLM-5.3-Flash - 智谱推出的高性价比原生多模态模型
GLM-5.3-Flash 是智谱 AI 推出的 GLM-5 系列首款原生多模态模型,拥有 320B 总参数和 18B 激活参数,支持 100 万 token 上下文。模型聚焦编程、智能体与专业办公任务,通过混合注意力架构降低推理成本,并以 MIT 协议开放模型权重。- 1.4k
- 0
-
Wan3.0正式上线:最长30秒视频生成,支持文档输入
阿里视频生成模型 Wan3.0 正式上线,在生成时长、参考一致性、真实感与多模态素材理解等方面升级,支持单次生成最长 30 秒视频,并新增 DOC、XLS、PPT、PDF、MD 等文档输入能力。目前已在阿里云百炼、万相、千问等多个平台开放体验。- 2.1k
- 0
-
DeepSeek-V4-Flash-Vision-Exp 上线,开放多模态 API服务
DeepSeek 上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,在保持 V4-Flash 文本能力的同时加入视觉理解,可处理图片分析、PPT 制作、网页重构和前端开发等任务。目前模型已开放 API,支持图文混合输入与 Files API。- 3.2k
- 0
-
DeepSeek-V4-Flash-Vision-Exp:DeepSeek推出的多模态视觉理解模型
DeepSeek-V4-Flash-Vision-Exp 是一款面向多模态 Agent 场景的实验性视觉理解模型,在保持 V4-Flash 文本能力的同时支持图文混合输入,可用于图片分析、商业 PPT、网页重构、前端开发及自动化工作流,主要通过 DeepSeek API 向开发者提供。- 1k
- 0
-
Qwen3.8 正式开源:27B 原生多模态模型开放,消费级显卡可部署
阿里正式开源 Qwen3.8 系列,Qwen3.8-27B 采用 270 亿参数原生多模态 Dense 架构,综合能力超过 Qwen3.7-Plus,支持编程、办公和视觉理解,采用 Apache 2.0 协议,量化后可在消费级显卡部署。- 5.8k
- 0
-
Google 发布 Gemini 3.7 Flash:强化 Coding 与 Agent,支持 100 万 Token 上下文
Google 正式发布 Gemini 3.7 Flash,新模型重点强化 AI 编程、Agent 工作流、Web 开发和专业知识处理能力,在多项软件工程与业务自动化测试中明显超过 Gemini 3.6 Flash。模型支持 100 万 Token 上下文,目前已正式 GA,可用于生产环境。- 1.6k
- 0
-
Gemini 3.7 Flash - Google 推出的高效 Coding 与 Agent 模型
Gemini 3.7 Flash 是 Google 推出的新一代高效 AI 模型,重点强化 AI 编程、多步骤 Agent、Web 开发和专业知识工作,支持多模态理解、工具调用和复杂业务工作流,并以更低成本面向开发者和企业提供服务。- 1.2k
- 0
-
Grok 4.6 正式发布:强化长任务 Agent 与 AI 编程,支持 50 万 Token 上下文
SpaceXAI 正式发布旗舰模型 Grok 4.6,重点强化长时间 Agent、AI 编程、知识工作和交互式应用开发能力,支持文本与图像输入以及 50 万 Token 上下文。新模型进一步提升复杂任务的持续执行能力,并已通过 Grok、API 及第三方开发工具提供使用。- 5.2k
- 0
-
Grok 4.6 - SpaceXAI 推出的长任务 Agent 与 AI 编程旗舰模型
Grok 4.6 是 SpaceXAI 推出的旗舰 AI 模型,重点强化长时间 Agent、AI 编程、知识工作和交互式应用开发能力,支持文本与图像输入、50 万 Token 上下文,可处理大型代码库、复杂研究和多步骤任务,并通过 Grok、API 及第三方开发工具提供使用。- 1k
- 0
-
Meta 发布开源模型 Muse Glimmer:30B 参数,Apache 2.0 协议,单张消费级显卡可运行
2026 年 8 月 10 日,Meta Superintelligence Labs 发布开放权重多模态模型 Muse Glimmer,这是该实验室成立以来首个公开权重的模型,也是 Meta 首次采用 OSI 认可的 Apache 2.0 协议发布模型,此前 Llama 系列使用的是带月活规模门槛的自定义社区许可。模型从旗舰闭源模型 Muse Spark 蒸馏而来,定位于常驻本地运行的智能体工作…- 2.1k
- 0
















