加载中…
共 14 条相关内容
Anthropic 阻止了中国人工智能实验室针对 Claude 的大规模蒸馏攻击
OpenAI 的 GPT-6 Astra 在 FrontierMath 上得分为 97.6%,而内部版本开始时得分仅为 17%
Salesforce 与 Anthropic 合作,将 Claude AI 集成到其生态系统中
Goldman Sachs partner warns of 'huge danger' in letting AI replace bankers' reasoning skills
在中美之间不断升级的人工智能军备竞赛中,与阿里巴巴、DeepSeek 和 Moonshot 相关的运营商从 Claude 那里收获了近 1.9 亿次交易。该公司 2026 年 9 月的威胁情报报告详细介绍了五项不同的蒸馏活动,在 2026 年 5 月至 7 月期间,这些活动总共与 Claude 产生
要点 该报告表明,人工智能蒸馏可以提高推理能力,从而有可能提高能力。市场似乎认为这些发展可能会影响 Anthropic 在人工智能模型排名中的竞争地位。人工智能模型竞争格局的任何更新,特别是涉及 Anthropic 的 Claude 模型,都可能影响市场看法。
从 17% 的内部数学分数跃升到近乎完美的基准测试结果,说明了 AI 推理模型的发展速度有多快 OpenAI 的最新推理模型 GPT-6 Astra 于 9 月 3 日推出,在 FrontierMath Tier 4 (v2) 上得分为 97.6%。这个数字会让你三思而后行,尤其是当你了解到该模型的
微软研究人员找到了一种方法,可以让更便宜的人工智能模型胜过其昂贵的推理模式,而这个技巧的成本大约相当于一杯拿铁咖啡。无需模型重新训练。在基准测试中,技能增强模型使用的输出标记比推理模式少 2.7 到 6 倍。
一个花费约 1,000 至 1,500 美元训练的 10 亿参数模型正在发布基准分数,可与更大、更昂贵的替代方案竞争 总部位于新加坡的 AGI 研究公司 Sapient Intelligence 发布了 HRM-Text 的完整权重、预训练代码和数据管道,HRM-Text 是一种基于分层推理模型架构
Anthropic 的 Claude 使用 Lean 4 生成了费马大定理的第一个完整的机器检查形式化,Lean 4 是一个证明助手,其功能就像一位残酷诚实的数学老师,拒绝让你跳过任何步骤。形式化实际上意味着什么 安德鲁·怀尔斯 (Andrew Wiles) 于 1995 年证明了费马大定理,数学界
这家 CRM 巨头将在 2026 年斥资 3 亿美元购买 Anthropic 代币,并使 Claude 成为其产品套件的默认推理引擎。Salesforce 计划在 2026 年期间向 Anthropic 代币投资约 3 亿美元,而这家人工智能公司现有的股权价值约为 50 亿美元。为什么这会重塑企业人
该模型在编码、多步推理和法律任务性能等多个关键基准上的表现优于 Anthropic 的 Claude Opus 5,该模型每个输出令牌的成本大约是其七倍。更重要的是:Gemini 3.8 Flash 的定价为每百万个输入代币 0.75 美元,每百万个输出代币 3.75 美元。Anthropic 将
最重要的数字是:ARC-AGI-2 基准测试的覆盖率达到 90%,而每项任务的成本比其前身《神鬼寓言 5》(每项任务的经验证价格为 5.45 美元)低 32%。基准收益的背景 《神鬼寓言 5.1》在 ARC-AGI-2 上的覆盖率达到 90%,较《神鬼寓言 5》的验证分数 89.2% 显着提高。《神
一个名为 PatternEval 的新基准揭示了混合思维人工智能系统中的快捷推理模式如何产生明显更明显的错误,即使准确度分数在纸面上看起来很好。腾讯研究人员量化了多模式人工智能模型的重度用户可能注意到的一些轶事:当这些系统跳过“思考”步骤并直接跳到答案时,事情会更频繁地发生故障。根据该团队在 arXiv 上发表的新论文,旗舰模型中思考和非思考推理失败率之间的差距高达 48.64%。这项题为“超越正确性:混合思维 MLLM 中的基准测试和调整响应行为”的研究引入了名为 PatternEval 的诊断基准。