大模型一周密集更新:多模态价格腰斩,智能体加速学会“操作真实软件”
图像生成:从“能出图”到“可反复修改且素材一致”
据Google DeepMind官方发布与模型卡信息,Nano Banana 2.1基于Gemini 3.6 Flash,定位高效率图像生成与对话式编辑:1K图像的输出费用从每张约0.067美元降至约0.0336美元,4K从约0.151美元降至约0.0756美元,批量任务再减半;支持最多14张参考图融合,可保持多个人物与物体的一致性。模型已同步分发至Gemini应用、AI Studio、API、搜索AI Mode、Google Ads等七条产品线,旧版API将于10月29日停用。官方同时承认,小字号文字与复杂页面排版仍可能出现模糊或错误。行业媒体的解读比较一致:值得关注的不是版本号,而是降价、提质、全产品线铺开同时发生——对电商、设计、营销行业来说,图像生成的成本结构被重新改写。
开放权重继续上探:欧洲拿出万亿参数组合
据Mistral AI官方发布,Mistral Large 4为1万亿总参数、490亿激活参数的原生多模态MoE模型,上下文达100万token,支持超过160种自然语言并覆盖欧盟全部官方语言,官方称其在网络安全、金融、法律等企业级负载上达到开源模型的前列水平,模型权重计划本月底开放下载。也有独立评测指出其部分榜单成绩与官方口径存在差距,建议等权重落地后再复现验证。对企业选型的启示是:开源与闭源的差距在收窄,涉及数据不出域的场景,开放权重模型的可选项正在变多。
智能体竞速:从“会说”到“会做”
据OpenAI官方发布,其推出Ironclad评测体系,用更细颗粒度的任务衡量模型操作真实软件的能力,新一代模型在该评测上较上一代有明显提升;同期谷歌Gemini API集中更新,覆盖图像、语音、智能体与视频四条线,其中智能体框架与长视频理解均有实质改进。行业观察人士把这轮竞速概括为:大模型厂商的战场正从“对话质量”转向“替人干活”——操作网页、填写表单、处理文档这类真实工作流,是下一阶段产品化的焦点。
对企业的务实意义:不是追新,是重算成本账
普通企业不必追着每个版本跑,但有两本账值得重算。一是内容生产成本:商品图、海报、详情页这类重复性视觉工作,新一轮降价后用AI辅助的边际成本又降了一截,可以把“哪些图必须人工精修、哪些可以AI初稿+人工把关”重新排一遍。二是流程自动化的可行性:智能体操作软件的能力在快速成熟,客服应答、资料整理、单据核对等规则清晰的流程,可以开始小范围试点,用有边界的任务验收效果,而不是听演示下结论。智汇云创为西北企业提供AI应用落地咨询与AI搜索时代的GEO布局服务,欢迎联系张总:186-0931-8698交流。
信息来源:Google DeepMind官方发布与模型卡、Mistral AI官方发布、OpenAI官方发布、钛媒体及行业媒体公开报道(2026年10月6日至7日),文中价格与评测数据均为官方口径,本文仅作综述。