近日,AI大模型市场迎来密集更新。Anthropic、Google和Meta接连发布新模型,竞争焦点从单纯比拼模型智力,转向编码、Agent和复杂任务执行等实际工作能力。
Google:发布 Gemini 3.8 Flash 及 Cyber 版
Google 推出 Gemini 3.8 Flash,支持100万Token上下文,提供低、中、高三档推理强度,以平衡性能、延迟与成本。该模型在软件工程、Agent任务和多步骤推理上表现优异,第三方测试显示其最高推理强度得分达59分。Google建议对算力敏感的场景选择较低推理强度或继续使用3.7 Flash。
同时发布的 Gemini 3.8 Flash Cyber 专用于网络安全防御,具备发现与自动修复漏洞的能力。在漏洞修复测试中表现接近前沿模型且成本更低,目前仅通过 Fairwind Program 向受信任的防御者开放。
Meta:推出 Muse Spark 1.3
Meta 发布 Muse Spark 1.3,继续围绕 Agent 和编程能力加码。新模型针对长周期编码和复杂任务优化,能在一个对话线程中处理多个工作流,主动修正计划并记住上下文。
在效率方面,相比上一代,Muse Spark 1.3 的工具调用次数减少约20%,Token使用量减少约25%。此外,模型增强了安全能力,包括对抗提示词注入及高风险操作确认。目前已上线 Muse Code 和 Meta Model API。
竞争转向“干活能力”
这轮新品发布表明,大模型竞争已进入新阶段。Claude Fable 5.1 主打复杂推理与专业知识;Gemini 3.8 Flash 兼顾智能与性价比;Muse Spark 1.3 则聚焦长任务执行效率与成本控制。未来的核心在于谁能率先让 Agent 在真实工作流中干得更久、更稳、更快且成本可控。
原始来源: 36氪 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。