ARC - AGI - 3测试」共找到 2171 篇相关文章

新闻资讯7

GPT-5编程成绩有猫腻!自删23道测试题,关键基准还是自己提的

有人发现OpenAI测试GPT-5编程能力时,用的SWE-bench Verified子集仅477题,自行省略23题。若这些题默认零分,其得分比Claude Opus 4.1低。且该基准还是OpenAI自己提出的。

量子位
新闻资讯7

GLM-5.2真正的跨越:CritPt密闭物理数据集测试得分20.9%,打平Opus-4.8

GLM - 5.2在CritPt密闭物理数据集测试中表现亮眼,与Claude Opus 4.8得分并列,远超其他开源模型,还击败多款闭源模型,实现4.5倍代际飞跃,标志开源模型科学推理能力进步。

AI寒武纪
新闻资讯8

AGI很蠢?AI教父Hinton预警:4.8万亿美元市场已锁死,AI正撕裂全球!

AI教父Hinton在全球数字世界大会警告,全球AI产业膨胀,仅1%研发投入用于安全。他认为AGI是愚蠢术语,真正该关注超级智能。还指出AI有三类风险,像烟草石棉一样,法规或难防危害外流。

新智元
新闻资讯8

谷歌诺奖大神哈萨比斯:五年内一半几率实现AGI,游戏、物理和生命的本质都是计算

谷歌DeepMind掌门人Demis Hassabis与Lex Fridman深度对话,预测未来五年有50%几率实现AGI,还从新颖角度阐述自然界模式可被建模,畅谈AI对游戏、科学研究等多领域的影响及应用。

AI科技大本营
新闻资讯8

Andrej Karpathy 开炮:智能体都在装样子,强化学习很糟糕,AGI 十年也出不来

本周五,Andrej Karpathy 长达两小时多的采访视频引发关注。他直言行业步子迈得太大,嘲讽 AI 现状夸大、脱离实际。他认为智能体成熟需十年,强化学习糟糕,还探讨了 AGI、人类学习、教育未来等多方面问题。

机器之心
新闻资讯8

GPT-6 Astra 正式登场:烧了 10 万块 GPU、多项跑分逼近满分,OpenAI 总裁:我们迎来 AGI 时代

今天凌晨,OpenAI正式发布GPT - 6 Astra。它多项跑分逼近满分,OpenAI总裁称其或意味着AGI时代开始。该模型在多方面能力领先,安全措施升级,将在‘未来几天’面向部分用户推出。

AI前线
新闻资讯8

Anthropic CEO最新采访:AGI一词毫无意义、点名扎克伯格、谈开源、家庭……等八个非共识观点

Anthropic CEO Dario Amodei在采访中给出八个非共识观点。他认为AGI和ASI是空洞概念,年亏30亿美元是投资,开源作用被高估,还谈及公司应对挖角、竞争、市场定位等策略,展现独特领导风格。

AGI Hunt
算法论文8

68页论文再锤大模型竞技场!Llama4发布前私下测试27个版本,只取最佳成绩

《排行榜幻觉》论文指出Chatbot Arena存在问题,如少数大厂私下多版本测试选最优、数据访问不平等、用Arena数据训练可提性能、模型被大量静默弃用等,研究团队给出改进建议,官方也进行了回应。

量子位
新闻资讯7

刚刚!OpenAI正式官宣调整公司结构:奥特曼发全员信承认AGI会由多家公司实现

OpenAI宣布调整公司结构,非营利组织继续控制,盈利实体转型公益企业(PBC),采用常规股权结构,非营利组织成PBC大股东。Sam Altman称这非出售,是结构简化调整,目标是让AGI惠及全人类。

AI寒武纪
算法论文8

斯坦福英伟达推出测试时强化学习:微调开源模型胜过顶级闭源模型,仅需几百美元

斯坦福、英伟达等提出TTT - Discover方法,基于开源模型gpt - oss - 120b,在测试阶段引入强化学习更新模型权重。它采用熵目标函数和PUCT启发机制,解决分布外问题,成本低且表现优,但目前适用于连续奖励场景。

量子位