-
豆包工作正式上线:支持电脑操作与团队协作
8 月 25 日,字节跳动正式上线 AI 办公产品“豆包工作”,面向个人与企业团队提供智能任务执行服务,推动豆包从传统对话助手进一步升级为能够处理实际工作的 AI 智能体。 豆包工作的核心是“工作任务”模式。用户通过自然语言描述需求后,AI 可自主理解目标、拆解任务,并调用本地电脑、浏览器、文档、表格和 PPT 等工具完成操作,适用于资料搜集、数据分析、报告撰写、演示文稿制作和文件整理等场景。 在…... -
Wan3.0正式上线:最长30秒视频生成,支持文档输入
阿里视频生成模型 Wan3.0 正式上线,在生成时长、参考一致性、真实感与多模态素材理解等方面升级,支持单次生成最长 30 秒视频,并新增 DOC、XLS、PPT、PDF、MD 等文档输入能力。目前已在阿里云百炼、万相、千问等多个平台开放体验。... -
DeepSeek-V4-Flash-Vision-Exp 上线,开放多模态 API服务
DeepSeek 上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,在保持 V4-Flash 文本能力的同时加入视觉理解,可处理图片分析、PPT 制作、网页重构和前端开发等任务。目前模型已开放 API,支持图文混合输入与 Files API。... -
MiniMax Design 上线:用 Agent 完成从创意到成片
MiniMax 推出多模态 AI 创作平台 MiniMax Design,可理解用户的创作意图,自动拆解任务并调用模型与 Skills,完成脚本、分镜、素材生成、视频编辑和成片交付。... -
阿里巴巴发布 HappyShrimp:一句话生成完整歌曲,让想象直接成为音乐
2026年8月17日,阿里巴巴正式推出全新 AI 音乐模型 HappyShrimp,中文名“快乐虾米”。 和不少依赖曲风、乐器、BPM 等专业标签的 AI 音乐工具不同,HappyShrimp 更强调对自然语言创作意图的理解。用户不需要掌握专业乐理,只需描述一种情绪、一个故事、一段记忆,甚至输入“写一首适合咖啡馆播放的歌”“写给刚毕业的自己”,模型就可以将这些生活化语言转化为具体的音乐设计。 从一…... -
Qwen3.8 正式开源:27B 原生多模态模型开放,消费级显卡可部署
阿里正式开源 Qwen3.8 系列,Qwen3.8-27B 采用 270 亿参数原生多模态 Dense 架构,综合能力超过 Qwen3.7-Plus,支持编程、办公和视觉理解,采用 Apache 2.0 协议,量化后可在消费级显卡部署。... -
Google 发布 Gemini 3.7 Flash:强化 Coding 与 Agent,支持 100 万 Token 上下文
Google 正式发布 Gemini 3.7 Flash,新模型重点强化 AI 编程、Agent 工作流、Web 开发和专业知识处理能力,在多项软件工程与业务自动化测试中明显超过 Gemini 3.6 Flash。模型支持 100 万 Token 上下文,目前已正式 GA,可用于生产环境。... -
DeepSeek Harness 开发者预览版发布:MIT 开源,采用“一切皆插件”架构
DeepSeek 正式发布 DeepSeek Harness v0.1 开发者预览版,并以 MIT 协议开放源代码。该框架采用“一切皆插件”的开放架构,模型、工具、Skills、沙箱、存储、调度及 UI 等 Agent 能力均可自由组合,并支持四种不同运行模式。... -
Grok 4.6 正式发布:强化长任务 Agent 与 AI 编程,支持 50 万 Token 上下文
SpaceXAI 正式发布旗舰模型 Grok 4.6,重点强化长时间 Agent、AI 编程、知识工作和交互式应用开发能力,支持文本与图像输入以及 50 万 Token 上下文。新模型进一步提升复杂任务的持续执行能力,并已通过 Grok、API 及第三方开发工具提供使用。... -
DeepSeek V4 Pro API 正式发布:支持100万Token上下文,最高输出384K
DeepSeek V4 Pro API 正式版上线,最新模型版本为 DeepSeek-V4-Pro-0813,支持 100 万 Token 上下文、最高 384K Token 输出、思考模式、Tool Calls,以及 OpenAI、Anthropic 和 Responses API。... -
Meoo团队版全量上线:接入Qwen-3.8-Max,面向企业提供一站式AI应用创作
Meoo秒悟团队版正式上线,新增统一身份管理、积分共享、权限体系和团队技能市场,并接入Qwen-3.8-Max,升级Meoo CLI,支持Qoder、Claude Code、Codex和Cursor等Agent平台。... -
Meta 发布开源模型 Muse Glimmer:30B 参数,Apache 2.0 协议,单张消费级显卡可运行
2026 年 8 月 10 日,Meta Superintelligence Labs 发布开放权重多模态模型 Muse Glimmer,这是该实验室成立以来首个公开权重的模型,也是 Meta 首次采用 OSI 认可的 Apache 2.0 协议发布模型,此前 Llama 系列使用的是带月活规模门槛的自定义社区许可。模型从旗舰闭源模型 Muse Spark 蒸馏而来,定位于常驻本地运行的智能体工作…... -
火山引擎上线 Seedance 2.5 API:支持 30 秒视频直出,强化电影级长叙事能力
火山引擎正式上线 Seedance 2.5 API,支持最长30秒视频直出和最高50个全模态素材参考,在指令遵循、长叙事、真人感、镜头表现、声画质感和多角色一致性等方面进一步提升,面向影视、广告、教育、工业及互动内容等场景。... -
阿里发布 Wan 3.0 视频生成模型:最长可稳定直出30秒视频
阿里通义新一代视频生成模型 Wan 3.0 正式开启公测,支持最长30秒视频一镜到底,全面提升镜头语言、角色真实感及人物、道具与场景一致性,适用于短剧、影视创作和营销广告。... -
腾讯混元发布 Hy ASR 3.0 preview:引入上下文理解,支持方言、术语与复杂环境识别
2026年8月4日,腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview。该模型基于 Hy3 大语言模型的语言理解能力,将高精度语音识别与上下文语义理解结合,重点提升方言、中英文混说、同音词、专业术语及复杂声学环境下的转写效果。 与传统语音识别主要依赖声学信号进行逐字转写不同,Hy ASR 3.0 preview 会结合前后文判断用户语境和表达意图,再生成对应文字。例如面对“期中考…...














