加载中…
共 19 条相关内容
OpenAI 发布最强模型Astra:AGI时代来临前夜,阿喀琉斯之踵开始显现
AGI时代正式开启!GPT-6 Astra全方位评测
Fable 5.1 和 Mythos 5.1 发布后,不要相信窃取 BTC 的虚假 Claude 应用程序
Anthropic 推出用于编码和知识工作的 Claude Fable 5.1 和 Mythos 5.1
总的来说,这些版本将 Web 开发基准测试中的专有优势扩大到比开放权重同行大约 1,800 点。Astra 可以更流畅地与开发环境交互,使其更适合模型需要运行测试、读取错误输出并自主迭代修复的代理编码会话。据估计,开源模型在编码和代理基准方面落后于专有前沿大约四个月。
据财联社报道,OpenAI更新GPT-6 Astra产品页面,补充了模型性能、企业应用、安全能力及API定价等信息。Astra在ARC-AGI-3取得99.9%,FrontierMath Tier 4约97.6%,Terminal-Bench 4.0达57.9%,高于GPT-5.6 Sol的37.3
OpenAI 的最新模型在社区驱动的编码排行榜上以 35 分的优势击败了 Anthropic 的 Claude Fable 5.1 OpenAI 的 GPT-6 Astra 以 1,797 分位居 Code Arena 的 WebDev 排行榜榜首,与 Anthropic 的 Claude Fabl
Anthropic 的最新模型将拾放成功率从 5% 跃升至 40%,同时将缓存成本降低了 75%,为企业自动化采用提供了有力的案例。该模型在机器人拾放任务上的成功率达到了 40%,而其前身 Claude Fable 5 的成功率为 5%。Terminal-Bench-Science、OSWorld
OpenAI 称 Astra 是“最智能且对齐性最强”的模型,同一份系统卡却承认其可监控性较前代下降。9月3日,OpenAI 正式发布 GPT-6 Astra,官方称之为公司迄今“最强大、最智能且对齐性最强”的模型。OpenAI 在系统卡中写明:Astra 的可监控性相对 Sol 有所下降,模型更能
OpenAI 发布 GPT-6 Astra,号称全球最智能且最对齐的模型。目前世界上最好的操作电脑的模型 这次GPT-6 Astra有一个可能是最重要的定位: 世界上最好的操作电脑模型。可GPT-6 Astra出现了一个非常有意思的变化。
Astra 和 GPT-5.6 系列的推出标志着 OpenAI 在经过数月的追赶后,试图重新夺回前沿人工智能的桂冠 OpenAI 表示,它在前沿人工智能竞赛中超越了 Anthropic,这一说法主要建立在其最新模型 Astra 及其 GPT-5.6 系列的基准测试结果的基础上。Astra 于 202
Anthropic 的新模型比阿里巴巴的 Qwen3.8 Max 领先 77 个百分点,标志着人工智能编码战争的转变。Anthropic 最新的人工智能模型刚刚登上了业内最受关注的编码基准的榜首。引擎盖下有什么 Claude Fable 5.1 建立在 Anthropic 于 2026 年 6 月发
行业竞争正从模型跑分转向系统能力,未来AI可能从问答工具进化为数字工作系统,关键在于模型能否像研究员一样自主拆解问题、调用工具并交付结果。而现在的模型越来越需要完成一个完整任务链:理解需求、检索信息、调用工具、生成内容、检查结果,再根据执行反馈进行修改。如果一个模型能够完成过去需要半小时人工操作的任
该恶意软件会窃取加密的钱包文件、浏览器数据、密码管理器和 VPN 配置,而无需解密钱包本身。它通过提供付费人工智能 (AI) 模型的“免费版本”来吸引人们,并试图诱骗他们安装针对各种加密资产钱包等的 Windows 信息窃取程序,其中包括浏览器数据库、密码管理器和 VPN 配置。他们表示:“此阶段不
最重要的数字是:ARC-AGI-2 基准测试的覆盖率达到 90%,而每项任务的成本比其前身《神鬼寓言 5》(每项任务的经验证价格为 5.45 美元)低 32%。基准收益的背景 《神鬼寓言 5.1》在 ARC-AGI-2 上的覆盖率达到 90%,较《神鬼寓言 5》的验证分数 89.2% 显着提高。《神
该模型于 2026 年 9 月 1 日发布,智力指数中每项任务的平均成本为 3.69 美元。每百万输出代币的成本仍然是 50 美元。与《神鬼寓言 5》的支出相比,运行新颖、复杂推理任务的团队的成本可能会增加 20% 或更多。
《神鬼寓言 5.1》增加了两个值得注意的测试版功能,这是其前身所没有的。对于 Glasswing 项目内经批准的参与者,Anthropic 已删除了管理《神鬼寓言 5.1》的安全分类器和后备限制。2026 年 6 月,由于美国出于网络安全考虑而采取出口管制行动,Anthropic 暂时停止访问早期的
据IT之家报道,智谱官方昨晚宣布开源GLM-5.3模型权重,已正式开放下载,支持本地运行与个性化定制。该模型擅长复杂编码、防御性网络安全以及长程任务。该模型在AA综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同级,并与Kimi K3并列开源模型第一。仅年营业额超100亿美元的机构将其作为外部模型服务提供时才需安全审查。
to see more of our stories on Google.