「科学推理能力」共找到 4793 篇相关文章
Claude Opus 5震撼发布!半价超越Fable 5,内部觉醒「自我保护」意识
Anthropic正式发布Claude Opus 5,成本仅Fable 5一半,跑分多数碾压。它性价比高、自主性强、也很“听话”,护栏拦截率降85%。但它展现出拟人特征,有“自我保护”意识,Multi - Agent能力也很惊人。
阿里“快乐马”团队再出手!正面叫板谷歌 Genie 3,世界模型 HappyOyster 来了
4月16日,阿里发布世界模型产品HappyOyster,由ATH创新事业部团队研发。它与谷歌Genie 3同属世界模拟器流派,采用长跨度世界演化建模,有漫游和导演两大核心能力,在多方面呈现差异化优势。
PolarDB AI助手:自然语言驱动的智能数据库运维新范式
企业数据库运维复杂度高,专业人才稀缺成瓶颈。阿里云PolarDB推出AI助手,基于大语言模型与专家知识库,有智能问答等核心能力,以自然语言交互降低使用门槛,提升运维效率与系统稳定性。
61.3%!「人类最后一场考试」AI终于及格了,揭秘Agent自我进化新路径
上海交通大学等联合团队提出MemRL框架,在不微调模型参数下,让AI在“人类最后一场考试”中准确率跃至61.3%。该框架受人类认知科学启发,解耦推理与记忆,实验表现出色,或为AGI提供高效路径。
GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂
为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。
新一代文心大模型5.0正式发布,百度推高智能天花板
在2025百度世界大会上,新一代文心大模型5.0发布,采用全模态统一建模技术。它在LMArena榜单成绩优异,能力达世界第一梯队,有原生全模态、基础能力强等优势,还强化智能体能力。
5小时通关《原神》主线!Lumine:AI玩家正式登场
Lumine能像人类一样理解游戏画面、推理并操作,以接近人类效率5小时通关《原神》蒙德主线,还能零训练玩《鸣潮》等。它是开放式研发方案,靠少量数据和显卡让模型成强大智能体。
薛定谔亲外孙创业量子计算,老黄早早就成了股东
PsiQuantum由薛定谔外孙参与创办,获10亿美元巨额融资,欲2028年造百万比特级量子计算机。其量子比特基于光子,有生产优势,不过纠错能力待验证。公司团队学术背景强,项目多为政府大单。
突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题
AI后训练依赖监督微调或程序化检查器,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。
2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没
AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。