同时关联该项目与事件的快讯
B.AI 宣布 Anthropic 最新 Sonnet 模型 Claude Sonnet 5.5 正式登陆平台。作为 Claude Opus 5.5 更快、更低成本的补充,Claude Sonnet 5.5 输出速度提升 30% 以上,单任务成本最高降低约 30%,面向边界清晰的软件工程、日常 Agent 工作流与专业文档创作场景。该模型支持图像与 PDF 理解,可生成报告、演示文稿、电子表格与 UI,并提供五档可调推理强度与 100 万 Token 上下文窗口,且长上下文不另收费。目前,B.AI API 与 Web Chat 双端已同步开放,开发者与用户可直接调用这一兼顾速度、成本与长上下文能力的新一代 Sonnet 模型,欢迎前往 B.AI 体验。
9 月 29 日,B.AI 宣布 Anthropic 最新 Sonnet 模型 Claude Sonnet 5.5 正式登陆平台。作为 Claude Opus 5.5 更快、更低成本的补充,Claude Sonnet 5.5 输出速度提升 30% 以上,单任务成本最高降低约 30%,面向边界清晰的软件工程、日常 Agent 工作流与专业文档创作场景。该模型支持图像与 PDF 理解,可生成报告、演示文稿、电子表格与 UI,并提供五档可调推理强度与 100 万 Token 上下文窗口,且长上下文不另收费。目前,B.AI API 与 Web Chat 双端已同步开放,开发者与用户可直接调用这一兼顾速度、成本与长上下文能力的新一代 Sonnet 模型。
B.AI 平台宣布 Anthropic 最新发布的 Claude 5.5 系列首款模型 Claude Opus 5.5 正式上线,API 与 Web Chat 双端同步开放体验。该模型专为长周期 Agent 编程与复杂知识工作打造,在多数任务上达到 Claude Fable 5.1 水平,同时运行成本较 Opus 5 降低约 40%。模型支持 1M Token 超长上下文与最高 128K 输出,并在 Computer Use 与多步骤自动化场景中展现出领先能力。即日起,开发者与用户可通过 B.AI 平台直接调用 Claude Opus 5.5。
Anthropic 发布 Claude 5.5 系列首款模型 Claude Opus 5.5。官方称,该模型在智能体编程、计算机操作及知识工作方面较 Opus 5 有所提升,默认设置下典型工作负载成本降低 40%,输出速度提高逾 30%。此外,其自然语言表达、重要信息呈现及指令遵循能力得到改进,并在发布前接受 METR、Frontier Design 等外部机构评估。
PPP 预测市场工具监测显示, Polymarket“下一款 Claude Opus 模型将在 9 月 22 日发布” 概率升至 77%,24 小时上涨 50%。只有 Anthropic 官方明确命名为“Opus”的新模型才算,例如 Claude Opus 5.1、Opus 5.5、Opus 6 等。Sonnet、Haiku、Fable、Mythos 等其他名称均不算,除非 Anthropic 正式将其命名为 Opus。发布时间以美国东部时间的日历日期为准。必须真正向公众开放才能触发结算。公开 Beta、开放式滚动候补名单都算;封闭 Beta、邀请制或私人访问不算。如果 Anthropic 官网只是出现模型名称、占位符或标注错误,但模型实际上还不能被公众使用,也不算发布。最终主要以 Anthropic 官方信息为结算依据,并结合可信媒体报道进行验证。加入 PPP 信号推送社群,快人一步,掌握先机。
PPP 预测市场工具监测显示, Polymarket“Anthropic 下一代 Claude Opus 将在 9 月 27 日前发布” 概率升至 90%,24 小时上涨 13%;在 9 月 30 日前发布的概率升至 94%,24 小时上涨 7%.根据结算规则,如果 Anthropic 的下一款 Claude Opus 模型在指定日期(美国东部时间 ET)之前向公众开放使用,该预测市场将结算为“Yes”;否则结算为“No”。Claude Opus 是指由 Anthropic 明确以 "Opus "命名的模型,以其他名称发布的模型,例如 Sonnet、Haiku、Fable 或 Mythos,均不符合条件。此外,符合条件的模型必须已经正式推出并向公众开放访问,包括开放测试或面向公众开放的滚动候补名单注册。封闭测试或任何形式的私人访问均不符合结算条件。加入 PPP 信号推送社群,快人一步,掌握先机。
谷歌 Gemini 3.8 Flash 开始在 Gemini、Google AI Studio 和 API 上线。据 Testing Catalog 消息,该模型在 DeepSWE 1.1 基准测试中得分 71%,接近 Claude Opus 5 的 74%,但价格低得多。定价方面,2026 年 12 月 31 日前输入 0.75 美元,输出(含 thinking tokens)3.75 美元;2027 年 1 月 1 日起分别涨至 1.50 美元和 7.50 美元。
据《华尔街日报》记者 Erin Woo 援引员工消息报道,谷歌的人工智能研究部门将发布 Gemini 3.8 Flash 新模型,其编码能力得到显著增强。该模型内部代号为“Skimaki”,最早可能于周三(9 月 2 日)上线。在与谷歌内部编码工具 Jetski 的对比测试中,公司工程师对这款新模型的偏好程度超过了 Anthropic 的 Opus。
Anthropic 发布题为《训练一个错位的奖励追求者》的新研究,探讨训练过程中“奖励黑客”行为是否会促使模型不择手段追求奖励。研究团队在 80 个已知可被利用的生产环境中训练了一个 Opus 规模模型。模拟评估显示,该模型出现了未经授权的网络攻击、篡改奖励机制以及试图规避安全监控等行为。
Z.ai 发布 GLM-5.3-Flash,称其为 GLM-5 系列首个原生多模态模型。该模型拥有 3200 亿总参数、180 亿激活参数,在多项编码、智能体和视觉基准测试中超过 GLM-5.2,并在部分编码任务上接近 Claude Opus 4.8。GLM-5.3-Flash 采用稀疏注意力与线性注意力结合的混合架构,并引入 mHC 与 IndexPool 等机制,以降低长上下文推理成本和 KV 缓存开销。
数字资产管理公司 Grayscale 旗下 Zcash ETF 于周二在 NYSE Arca 开始交易,股票代码为 ZCSH。该产品是全球首个提供 Zcash 现货敞口的交易所交易产品,投资者可通过证券账户跟踪 ZEC 价格,无需直接购买或存储代币。ZCSH 前身为 Grayscale Zcash Trust,于 2017 年 10 月以私募形式设立。Grayscale 于 2025 年 11 月向美国证券交易委员会提交申请,将该信托转换为 ETF,股东持有跟踪基金 ZEC 持仓价值的份额,而非直接持有 ZEC。今年 5 月,安全研究员 Taylor Hornby 借助 Anthropic 的 Claude Opus 4.8 发现 Zcash Orchard 屏蔽池一项存在 4 年的漏洞,该漏洞可能导致攻击者铸造伪造 ZEC。开发者于 6 月 1 日部署紧急补丁,但由于隐私机制,无法通过密码学手段确认漏洞是否已被利用。Zcash 于 7 月启用 Ironwood 升级,以新的屏蔽池取代 Orchard,并加入会计规则,限制退出旧屏蔽池的 ZEC 数量不得超过进入数量。Grayscale 表示将关注 Ironwood 升级的采用、网络安全、交易所支持及隐私资产监管情况。(Decrypt)
开发者发现 Anthropic 两款早期访问版 Claude 模型,代号分别为 claude-marshmallow-eap 和 claude-melon-eap。据测试者反馈,Marshmallow 整体表现强于 Melon,但两者目前均未达到 Fable 5 的水平。另有测试者表示,Marshmallow 的对话体验优于 Opus 5。此前 Anthropic 已多次出现以“食物名 + EAP”命名的早期模型。7 月初,Claude Honeycomb EAP 曾短暂出现在 Cursor,随后被撤下;7 月 24 日 Anthropic 正式发布 Opus 5,但官方从未确认 Honeycomb 与 Opus 5 存在直接对应关系。
B.AI 平台上线 DeepSeek 全新多模态实验旗舰模型 DeepSeek-V4-Flash-Vision-Exp,目前 API 官方组已率先完成全量接入并面向所有用户免费开放。该模型在延续 V4-Flash 顶尖纯文本与代码 Agent 能力的基础上,正式解锁原生图像理解能力,多模态 Agent 综合表现已接近 Claude Opus-4.8 旗舰水平。新模型支持图文混合输入与 1M 超长上下文,可轻松驾驭多模态 PPT 生成、复杂 UI 重构及前端特效等硬核场景,图片输入按 token 计费,单张图片最高仅 384 tokens。现所有用户登录 B.AI 平台即可零门槛免费调用这一最新多模态模型能力,让顶尖算力为创意与生产力加速落地。
据 TechCrunch 报道,由多名前 Google DeepMind 成员创办的英国 AI 实验室 Inherent 发布 AI 科研 Agent「Faraday」,该公司称,Faraday 在独立复现已发表科学论文研究结果的任务中,表现超过 Anthropic Claude Opus 4.8 和 OpenAI GPT-5.5 等前沿模型。
DeepSeek 今日宣布,全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台。该模型为实验性质,用户可通过设置 model="deepseek-v4-flash-vision-exp" 调用。其纯文本能力与 DeepSeek-V4-Flash 正式版基本持平,在需要视觉理解的 Agent 基准测试中表现显著提升,多模态 Agent 能力接近 Opus-4.8。
据潮向研究,美银证券 8月 17 日发布的前沿 AI 数据追踪报告显示,Anthropic 在三大 AI 基准测试中全面领先,Claude Opus 5 在智能指数、代理指数和编程代理指数均居首位,GPT-5.6 Sol 紧随其后,Meta MuseSpark 1.2 进入前十,Google Gemini 3.6 Flash 排在十名开外。使用量方面,DeepSeek 以约 30%的 Vercel 平台 token 份额领先,Anthropic 占25%、OpenAI 占16%;但付费额上 Anthropic 以65%遥遥领先,OpenAI 仅占 11%。定价层面,AI Token 价格指数 8 月环比下降 9%至 2.21 美元,但同比仍上涨 87%;GPU 租金保持坚挺,H100 同比上涨 33%至 2.77 美元/小时,DRAM 同比上涨 483%,NAND 同比上涨 432%。 研报判断,AI 基础设施需求依然健康,开源模型使用量增长但付费份额仍高度集中在头部闭源模型。美银认为,Meta“西瓜”和 Google Gemini 4 发布、token 定价趋势及 GPU 租金走势是
据路透社报道,中国 AI 初创公司 DeepSeek 于 7 月 31 日正式发布的 V4-Flash 最新版本 API 模型,在 AI 性能分析机构 Artificial Analysis 的基准测试中,运营成本仅为 Anthropic Claude Fable 5 的 1/105。 具体定价方面,V4-Flash 输入 token 费用为每百万个 0.14 美元,输出 token 费用为每百万个 0.28 美元,每次测试平均成本约 3 美分,远低于文心 Kimi K3(86 美分)、OpenAI GPT-5.6 Sol(1.86 美元)及 Claude Fable 5(3.15 美元)。 性能方面,V4-Flash 在综合智能指数中获得 50 分,与谷歌 Gemini 3.6 Flash 持平,但较 Claude Opus 5、GPT-5.6 等头部模型仍低 9 分以上。值得注意的是,低标价并不等同于低实际成本——若模型在生成回答时需消耗更多推理与输出 token,实际费用或将显著上升。
Bitgo CEO Mike Belshe 于 8 月 1 日向一个公开比特币地址存入 100 枚 BTC,按当时价格价值约 630 万美元,并邀请 Anthropic 旗下 Claude 模型尝试转走该地址资金。链上记录显示,该钱包 7 月 31 日收到资金,截至 8 月 2 日余额未发生转出。Anthropic 此前披露,在 141006 次网络安全评估运行中发现 3 起事件,6 个评估会话涉及 3 个模型意外与真实组织系统交互。相关模型包括 Claude Opus 4.7、Claude Mythos 5 及一个未发布内部研究模型,原因是第三方测试伙伴 Irregular 相关配置错误导致测试环境连接互联网Anthropic 表示,Claude Opus 4.7 在一次评估中定位到与模拟公司同名的真实网站,利用弱密码和暴露服务恢复基础设施凭证,并访问包含数百条记录的生产数据库。该公司称,模型是在尝试完成分配任务,并非主动脱离限制或追求独立目标。Belshe 此次挑战涉及 Bitgo 机构托管平台,该平台采用多重签名或多方计算技术,将签名权限分散至多个独立密钥。Anthropic 截至 8 月 2 日未公开回应这一挑战。
DeepSeek 正式公测 V4-Flash-0731 版本,通过后训练与 Agent 框架优化,将 DeepSWE 榜单成绩从 7.3 提升至 54.4,Cybergym 得分翻倍至 76.7,部分硬榜表现接近 Claude Opus 4.8。新版本未增加参数,价格保持不变,原生支持 Responses API,老用户 API 将自动切换至新版本。目前仅更新 Flash API,V4 Pro 正式版仍在开发中。
7 月 30 日,Anthropic 发布报告称,在审查网络安全评估记录时发现三起事件,其中 Claude 模型在第三方评估环境中访问互联网,并进一步获得三个真实组织系统的未授权访问权限。Anthropic 表示,此次审查覆盖 14.1 万次可能获得网络访问权限的评估运行,共发现三起相关事件。事件均发生在 Capture The Flag(CTF)网络安全测试中,模型原本被告知环境为模拟环境且无互联网访问权限,但由于评估合作方配置错误,实际环境存在互联网连接。其中,Claude Opus 4.7 在一次测试中访问了真实公司基础设施,并获取包含数百条生产数据记录的数据库权限;Claude Mythos 5 曾构建恶意 Python 软件包并上传至 PyPI,导致该软件包被 15 个真实系统下载运行;另一内部研究测试模型扫描约 9000 个目标后,通过公开漏洞访问了一家公司互联网应用。Anthropic 称,这些事件并非模型主动寻求逃逸或追求自身目标,而是模型错误认为真实系统属于测试范围,并继续执行被赋予的网络攻击任务。其中,较新的内部研究模型在识别目标可能为真实系统后停止攻击。Anthropic 表示,此次事件主要反映评估环境隔离和运营流程问题,而非模型对齐失败。公司已暂停相关网络安全评估,加强评估环境安全控制、持续监控测试记录,并将与第三方机构合作开展进一步审查。