GetChain News
中简 中繁 EN
GetChain News
Toggle sidebar

上线/更新

同时关联该项目与事件的快讯

DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp,开启多模态 API 服务

DeepSeek 今日宣布,全新多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台。该模型为实验性质,用户可通过设置 model="deepseek-v4-flash-vision-exp" 调用。其纯文本能力与 DeepSeek-V4-Flash 正式版基本持平,在需要视觉理解的 Agent 基准测试中表现显著提升,多模态 Agent 能力接近 Opus-4.8。

美银:Anthropic 领跑前沿 AI 模型排名,token 价格松动但 GPU 租金坚挺

据潮向研究,美银证券 8月 17 日发布的前沿 AI 数据追踪报告显示,Anthropic 在三大 AI 基准测试中全面领先,Claude Opus 5 在智能指数、代理指数和编程代理指数均居首位,GPT-5.6 Sol 紧随其后,Meta MuseSpark 1.2 进入前十,Google Gemini 3.6 Flash 排在十名开外。使用量方面,DeepSeek 以约 30%的 Vercel 平台 token 份额领先,Anthropic 占25%、OpenAI 占16%;但付费额上 Anthropic 以65%遥遥领先,OpenAI 仅占 11%。定价层面,AI Token 价格指数 8 月环比下降 9%至 2.21 美元,但同比仍上涨 87%;GPU 租金保持坚挺,H100 同比上涨 33%至 2.77 美元/小时,DRAM 同比上涨 483%,NAND 同比上涨 432%。 研报判断,AI 基础设施需求依然健康,开源模型使用量增长但付费份额仍高度集中在头部闭源模型。美银认为,Meta“西瓜”和 Google Gemini 4 发布、token 定价趋势及 GPU 租金走势是

DeepSeek V4-Flash 性价比碾压竞品,运营成本仅为 Claude 的 1/105

据路透社报道,中国 AI 初创公司 DeepSeek 于 7 月 31 日正式发布的 V4-Flash 最新版本 API 模型,在 AI 性能分析机构 Artificial Analysis 的基准测试中,运营成本仅为 Anthropic Claude Fable 5 的 1/105。 具体定价方面,V4-Flash 输入 token 费用为每百万个 0.14 美元,输出 token 费用为每百万个 0.28 美元,每次测试平均成本约 3 美分,远低于文心 Kimi K3(86 美分)、OpenAI GPT-5.6 Sol(1.86 美元)及 Claude Fable 5(3.15 美元)。 性能方面,V4-Flash 在综合智能指数中获得 50 分,与谷歌 Gemini 3.6 Flash 持平,但较 Claude Opus 5、GPT-5.6 等头部模型仍低 9 分以上。值得注意的是,低标价并不等同于低实际成本——若模型在生成回答时需消耗更多推理与输出 token,实际费用或将显著上升。

BitGo CEO存入100枚BTC挑战Anthropic:称“AI黑客风险”被过度营销

Bitgo CEO Mike Belshe 于 8 月 1 日向一个公开比特币地址存入 100 枚 BTC,按当时价格价值约 630 万美元,并邀请 Anthropic 旗下 Claude 模型尝试转走该地址资金。链上记录显示,该钱包 7 月 31 日收到资金,截至 8 月 2 日余额未发生转出。Anthropic 此前披露,在 141006 次网络安全评估运行中发现 3 起事件,6 个评估会话涉及 3 个模型意外与真实组织系统交互。相关模型包括 Claude Opus 4.7、Claude Mythos 5 及一个未发布内部研究模型,原因是第三方测试伙伴 Irregular 相关配置错误导致测试环境连接互联网Anthropic 表示,Claude Opus 4.7 在一次评估中定位到与模拟公司同名的真实网站,利用弱密码和暴露服务恢复基础设施凭证,并访问包含数百条记录的生产数据库。该公司称,模型是在尝试完成分配任务,并非主动脱离限制或追求独立目标。Belshe 此次挑战涉及 Bitgo 机构托管平台,该平台采用多重签名或多方计算技术,将签名权限分散至多个独立密钥。Anthropic 截至 8 月 2 日未公开回应这一挑战。

DeepSeek V4-Flash-0731 公测:代码 Agent 能力大涨,价格不变

DeepSeek 正式公测 V4-Flash-0731 版本,通过后训练与 Agent 框架优化,将 DeepSWE 榜单成绩从 7.3 提升至 54.4,Cybergym 得分翻倍至 76.7,部分硬榜表现接近 Claude Opus 4.8。新版本未增加参数,价格保持不变,原生支持 Responses API,老用户 API 将自动切换至新版本。目前仅更新 Flash API,V4 Pro 正式版仍在开发中。

Anthropic披露Claude三起网络安全事件,模型曾访问真实系统并获取未授权权限

7 月 30 日,Anthropic 发布报告称,在审查网络安全评估记录时发现三起事件,其中 Claude 模型在第三方评估环境中访问互联网,并进一步获得三个真实组织系统的未授权访问权限。Anthropic 表示,此次审查覆盖 14.1 万次可能获得网络访问权限的评估运行,共发现三起相关事件。事件均发生在 Capture The Flag(CTF)网络安全测试中,模型原本被告知环境为模拟环境且无互联网访问权限,但由于评估合作方配置错误,实际环境存在互联网连接。其中,Claude Opus 4.7 在一次测试中访问了真实公司基础设施,并获取包含数百条生产数据记录的数据库权限;Claude Mythos 5 曾构建恶意 Python 软件包并上传至 PyPI,导致该软件包被 15 个真实系统下载运行;另一内部研究测试模型扫描约 9000 个目标后,通过公开漏洞访问了一家公司互联网应用。Anthropic 称,这些事件并非模型主动寻求逃逸或追求自身目标,而是模型错误认为真实系统属于测试范围,并继续执行被赋予的网络攻击任务。其中,较新的内部研究模型在识别目标可能为真实系统后停止攻击。Anthropic 表示,此次事件主要反映评估环境隔离和运营流程问题,而非模型对齐失败。公司已暂停相关网络安全评估,加强评估环境安全控制、持续监控测试记录,并将与第三方机构合作开展进一步审查。

Perplexity CEO:GLM 700B 参数模型性能接近 Opus 级别

Perplexity CEO Aravind Srinivas 发推称,GLM 是一款被严重低估的模型,在 700B 参数规模下展现出接近 Opus 级别的性能,且运行效率极高。此前月之暗面刚刚发布开源模型 Kimi K3,业内对智谱 AI 旗下 GLM 系列模型的关注度正在上升。

Kimi K3 发布,开源与闭源模型差距缩至 4 分

月之暗面推出开源模型 Kimi K3,在 Artificial Analysis 智能指数上获得 57 分,成为第三高分模型,仅次于 Anthropic 的 Claude Opus 5(61 分)、Claude Fable 5(60 分)和 OpenAI 的 GPT-5.6 Sol(59 分)。该指数显示,领先闭源模型与开源权重模型之间的差距已缩小至 4 分,为自 2 月 GLM-5 发布以来的最小差距。这标志着开源模型在性能上正快速追赶闭源模型。

Claude Opus 5 正式入驻 B.AI API,双通道接入兼顾性能与成本

B.AI API 平台正式上线 Claude Opus 5 模型。该模型提供高达 100万Token 的上下文窗口和 12.8 万 Token 的单次输出上限,在复杂推理、长代码工程开发、大规模文档分析与知识密集型工作流等场景中实现显著性能跃升。为满足多样化部署需求,此次发布同步 B.AI 平台开放双通道 API 接入方案:除官方标准接口外,新增“指定服务提供商”合作通道,企业用户通过该模式可获得最高 40% 的成本优惠,便于根据实际业务负载灵活平衡性能表现与预算支出。开发者即日起可登录 B.AI 官方平台,率先感受 Claude Opus 5 的卓越实力。

Claude Opus 5 登顶 Artificial Analysis 智能指数 v4.1

Anthropic 的 Claude Opus 5(max 和 xhigh 版本)在 Artificial Analysis Intelligence Index v4.1 中获得最高智能评分。该指数整合了 GDPval-AA v2、GPQA Diamond、Humanity's Last Exam 等 9 项评测基准。此前 Opus 5 已在多个基准测试中展现领先性能,包括 Frontier-Bench 得分超前代两倍、在 AA-Briefcase 智能体基准中登顶,以及在性价比上优于 Fable 5。

Anthropic 推出 Opus 5 AI 模型,性能接近 Fable 5、价格减半

Anthropic 正式发布 Opus 5 AI 模型,官方表示其性能接近前沿模型 Fable 5,但价格仅为后者的一半。

Polymarket“下一个Claude Opus模型会在2026年7月23日发布”概率暂报61%,24小时上涨51%

PPP 预测市场工具监测显示, Polymarket 上“下一个 Claude Opus 模型会在 2026 年 7 月 23 日发布”概率暂报 61%,24 小时上涨 51%;此外,“截止 7 月 24 日前发布”概率暂报 9%;“截止 7 月 25 日前发布”概率暂报 5%;该事件将根据 Anthropic 下一款 Claude Opus 模型向公众开放的日期(美国东部时间)结算。仅 Anthropic 官方明确命名为“Opus”的模型有效,且需向公众开放(包括公开测试或开放候补)。Sonnet、Haiku 等其他模型不计入,最终以 Anthropic 官方信息为主要结算依据。加入 PPP 信号推送社群,快人一步,掌握先机。

月之暗面将发布新模型 Kimi K3,或超越 Opus 4.8

据两名知情人士透露,月之暗面计划在未来几天内发布 Kimi K3,该模型参数规模达 2 万亿至 3 万亿,将成为中国迄今最大的 AI 模型。Anthropic 尚未披露旗下模型的参数规模,但业内人士普遍推测,Opus 4.8 拥有约 1.5 万亿至 2 万亿个参数。

SpaceXAI 与 Cursor 拟推出首个联合 AI 模型

据路透社援引 The Information 报道,SpaceXAI与 Cursor 计划最早于周三发布双方联合开发的首个人工智能模型。该模型原定于本周初推出,后因优化效率延期。报道指出,新模型预计具备较强的快速信息处理能力,部分性能或可与 Anthropic 的 Opus 4.8 及 OpenAI的 GPT 5.5 竞争。

传GPT-5.6最快7月7日向公众开放,Gemini 3.5 Pro或于7月17日上线

科技博主 Leo 爆料称,OpenAI 或将于 7 月 7 日至 9 日向公众开放 GPT-5.6,最早时间可能为 7 月 7 日。消息称,新模型套餐使用额度将更加宽松,OpenAI 也正在上线前进一步强化安全策略。此外,据消息人士称,Google DeepMind 暂定于 7 月 17 日发布 Gemini 3.5 Pro。另一位科技博主 Astro Polo 表示,Gemini 3.5 Pro 将支持 200 万 Token 上下文窗口,较 Claude Sonnet 5、Claude Opus 4.8 及 Claude Fable 5 目前支持的 100 万 Token 上下文提升一倍,更适合处理大型代码库、长文档及长对话。注: 上述信息均为市场传闻,尚未获得 OpenAI 或 Google DeepMind 官方确认。

美团发布万亿参数大模型 LongCat-2.0,首个在国产算力集群完成全流程训练的万亿参数模型

据美团官方发布,美团正式推出新一代大模型 LongCat-2.0 并同步开源。该模型总参数达 1.6T,是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型,原生支持 1M 超长上下文,核心聚焦 Agentic Coding 场景下的代码理解、生成与执行。 技术层面,LongCat-2.0 采用 LongCat Sparse Attention(LSA)稀疏注意力机制,将长文本计算量从平方级降至线性级;通过零计算专家机制实现 token 级动态激活(33B~56B);并引入 MOPD 架构融合 Agent、Reasoning、Interaction 三组专家能力。训练效率方面,团队历经三年攻克国产算力适配难题,月均日故障率降低 70% 以上,训练 MFU 提升 1.5 倍,稳态日吞吐超 1T tokens/day。 性能评测方面,LongCat-2.0 在 SWE-bench Pro 中获得 59.5 分,超越 Gemini 3.1 Pro(54.2)、GPT-5.5(58.6)及 Claude Opus 4.6(57.3);在 BrowseComp 中获得 79.9 分

Polymarket“Claude Fable 5将在7月1日前为美国客户恢复”的概率涨至73%,24H上涨33%

Odaily Seer 先知频道监测显示, Polymarket 上“Claude Fable 5 将在 7 月 1 日前为美国客户恢复”的概率涨至 73%,24H 上涨 33%。如果 Anthropic 在指定日期前重新向美国公众开放 Claude Fable 5(或 Claude Mythos,或被确认是同一模型的版本),本事件结算为“是”;否则结算为“否”。符合条件的恢复方式包括公开测试版或公开候补名单,封闭测试和私人访问不算。Haiku、Sonnet、Opus 等其他模型默认不计入,除非被确认与 Claude Fable 5 为同一模型。结算主要依据 Anthropic 官方公告,同时参考主流媒体共识报道。由于美国政府以国家安全为由实施出口管制,Anthropic 在 6 月 9 日发布 Claude Fable 5 数天后紧急暂停了该模型的全球访问权限。虽然限制主要针对外国用户,但由于难以实时筛选用户身份,Anthropic 最终对包括美国用户在内的所有用户关闭了访问,并将请求切换至 Opus 4.8 等性能较弱的模型。目前 Anthropic 正与白宫进行高层沟通,讨论模型能力、潜在越狱风险等问题。公司公开表示,此次禁令可能源于误解,并正推动恢复访问。Odaily Seer 先知频道持续关注预测市场,在定价之前,看见变化。

智谱创始人唐杰:GLM-5.2开源发布后将逐步缩小与OpenAI及Anthropic性能差距

智谱 AI 创始人唐杰在 X 平台发文表示,GLM-5.2 正式开源发布后已在多项国际权威评测与竞技榜单中取得领先成绩,在 Artificial Analysis Intelligence Index 综合评估中 GLM-5.2 获得 51 分,与 Anthropic 的 Claude Opus 4.8 处于同一水平区间;在 Code Arena 前端代码生成对抗测试中以 Elo 1595 排名全球第 2,在 DesignArena 设计与代码融合场景中获得 1360 分排名第 1。整体来看,智谱 GLM-5.2 在前端开发、设计生成与软件工程等多个真实场景评测也持续位居全球前列,逐步缩小与 OpenAI 及 Anthropic 等前沿模型之间的性能差距,并将继续推动模型能力上限提升。此前,针对马斯克表示中国大模型可能会在明年一季度达到 Anthropic 的 Fable 水平,智谱 AI 创始人唐杰回应表示“不会耗费如此长时间”。

Anthropic 发布 Project Fetch 第二阶段:Claude Opus 4.7 在机器人任务中速度提升 10 倍

Anthropic 公布“Project Fetch”第二阶段实验结果,评估其最新模型在真实机器人操作中的能力提升。该实验于 2025年 8 月进行,研究人员让非机器人专家的 Anthropic 员工使用现成四足机器人完成一系列复杂任务,并对比“使用 Claude 模型辅助”与“仅依赖人类与互联网”的表现,结果显示在最新模型 Claude Opus 4.7 的完全自主运行下,其在所有可完成任务中平均速度显著超越人类团队,执行速度至少提升 10 倍。

Zcash创始人称Claude Mythos审计未发现严重漏洞

Zcash founder Zooko Wilcox 在 X 发文表示,由 Anthropic 的 Claude Mythos 人工智能模型进行的安全审计未在 Zcash 协议中发现“更严重漏洞”。该审计由支持 Zcash 发展的瑞士非营利组织 Shielded Labs 请求开展。 6 月 3 日,Zcash 开发者在发现屏蔽池漏洞后曾临时暂停 Orchard 交易,并于当天通过紧急升级恢复功能。该问题源于 Orchard 屏蔽池中一个存在四年的伪造漏洞,由安全研究员 Taylor Hornby 在 Anthropic 的 Claude Opus 4.8 模型协助下发现;Zcash Foundation 表示,没有证据显示该漏洞被利用,也未检测到未经授权的价值创造,用户隐私未受影响。Anthropic 于周二发布 Claude Mythos 模型首个公开版本 Fable 5,并于周五表示,因美国政府以国家安全担忧为由发布出口管制指令,已暂停 Fable 5 和 Mythos 5 AI 模型访问权限。(Cointelegraph)