物理推理能力」共找到 4866 篇相关文章

产品应用8

Claude Opus 4.7发布:更严谨的长任务处理与自我验证能力

Anthropic发布Claude Opus 4.7模型,相比4.6版处理长任务更严谨,能自我验证输出。它在视觉、指令遵循、记忆等能力上提升,企业级应用表现出色,还有新功能与安全特性,不过使用成本更高。

AI工程化
开源动态7

数学编码超越O3-high,英伟达版「DeepSeek R1二代」推理模型开源~

Nvidia开源OpenReasoning-Nemotron系列模型合集,采用Qwen2.5架构,基于500万条轨迹训练。评测输出长度最高64K token,多版本刷新SOTA。其‘heavy’模式有独特能力,32B版在数学与编程基准超越O3(High)。

PaperAgent
新闻资讯7

GPT-5.4发布,拥有原生计算机操作能力,像是给OpenClaw量身打造的模型。

OpenAI凌晨发布GPT-5.4,或是4o模型后提升最大的一次。它价格较合理,有原生计算机操作能力,支持100万token上下文,还有工具搜索功能可降47% token损耗,与OpenClaw适配性佳。

开源AI项目落地
新闻资讯7

AI 编程冲击来袭,程序员怎么办?IDEA研究院张磊:底层系统能力才是护城河

在AICon全球人工智能开发与应用大会上,IDEA研究院张磊接受专访,剖析多模态智能体落地路径,分享工业界平衡研究与产品的见解,还为年轻人在AI浪潮中发展给出建议,指出底层系统能力是关键。

InfoQ
开源动态7

小模型也能精确计算:WorldModel-Qwen的推理时代码执行实验

开发者bigattichouse让Qwen - 0.6B小模型推理时生成并执行WASM代码获计算结果。最初尝试加标签生成Python代码效率低,后用WASM,创建三层架构。虽结果未完美,但接近,还通过Gemini审查验证。

AI工程化
产品应用8

文心X1.1发布!这三大能力突出,一手实测在此

百度深度思考模型文心X1.1升级上线,在事实性、指令遵循、智能体等能力显著提升,实测表现佳。WAVE SUMMIT 2025大会还发布开源模型ERNIE - 4.5 - 21B - A3B - Thinking等,飞桨框架也升级到v3.2。

量子位
算法论文8

用雨伞「钓」无人机?首个针对自主目标跟踪闭环系统的物理攻击

加州大学尔湾分校研究人员用特制雨伞干扰无人机视觉系统,实现FlyTrap攻击,让无人机误判目标远去而失控俯冲。此攻击无需信号干扰,成功率超60%,有强泛化能力,揭示了AI感知系统安全隐患。

新智元
算法论文8

Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜

Einsia AI旗下Navers lab发布Agent Benchmark——Frontier-Eng Bench,让AI在47个多学科交叉的硬核任务中做工程优化,测试其迭代优化能力。研究总结出AI进化规律,初步勾勒接近真实工程循环的AI系统。

量子位
新闻资讯7

反转!LeCun刚转发「全球最快开源推理模型」,ETH苏黎世就直接打假

上周,MBZUAI与G42等开源号称「全球最快的开源AI推理模型」K2 - Think,引发广泛关注,图灵奖得主Yann LeCun也转发相关推文。但三天后,ETH苏黎世研究员发文指出该模型存在数据污染、评估方式不合理等问题。

新智元
产品应用8

阶跃星辰发布新一代基模 Step 3,原生多模态推理模型,性能达到开源 SOTA

WAIC 2025期间,阶跃星辰上线新一代基础大模型Step 3,7月31日将面向全球开源。还成立“模芯生态创新联盟”,与上海国有资本投资有限公司合作。Step 3性能达开源SOTA,推理效率高,适配多种芯片。

Founder Park