物理基准测试」共找到 2463 篇相关文章

产品应用7

Claude后台接管电脑,真·赛博替身!人机并行时代来了

Anthropic宣布全面升级Claude「计算机使用」能力,操作可在后台完成。该功能处于Beta测试,已向Claude Pro和Max订阅的macOS用户开放。Claude此次更新覆盖多场景,人机并行时代或来临。

新智元
算法论文8

AI终于“长”进机器人身体里!机械臂学会用触觉思考

香港科技大学申亚京教授团队研发出具身机器人手臂 EmArm,实现亚毫米级触觉定位与实时‘感知 - 行动’闭环。研究还提出‘感知 - 驱动’一体化算法,为打造物理 AI 机器人提供可扩展技术路径。

DeepTech深科技
推荐文章7

AI 能力越来越强,那么它生成的代码,人类还需要去理解吗?

《代码整洁之道》作者罗伯特·C·马丁不逐行看 Agent 代码,设好测试框架通过就行。Notion 工程师 Geoffrey Litt 在会议探讨人类是否需理解代码,多数人认为需要,Litt 分享理解代码方法。

特工宇宙
开源动态8

当「变大」不再是唯一的路,又一国产模型开源了

2026年6月智谱开源GLM - 5.2,心洲科技前沿实验室Mind Lab开源Macaron - V1,基座升级至GLM - 5.2。它押注持续学习与群体智能,成绩优于基座,相关理念和工程路径获验证。

机器之心
算法论文8

满分的「差」,Qwen与复旦等揭示编程智能体奖励设计的结构性困境

Qwen团队与复旦等联合发表论文《The Verification Horizon: No Silver Bullet for Coding Agent Rewards》,指出编码智能体奖励设计存在结构性困境,任何奖励信号只是人类意图的‘替身’,验证需成系统与智能体协同演化,并研究多种验证者。

机器之心
新闻资讯7

同济出手!国产AI,第一次进攻土木工程

近年来AI应用发展迅速,从「理解数字世界」迈向「改变物理世界」。海光携手同济大学推出全国首个国产千卡工科智算集群,为AI4E时代提供解决方案,助力其从实验室走向工程实践。

新智元
产品应用7

80%代码由Claude合并,Anthropic内部人员点破Agent真相:「Close the Loop」

Anthropic团队研究产品经理Theo演讲指出,Claude已深入其工程流程,超80%代码由它合并。模型角色转变,能力提升,失败率下降。开发者应升级研发战术,如刷新评估基准、精简“脚手架”、闭环设计。

机器之心
算法论文8

10万token自然语言推理,让30B-A3B模型站上奥赛金牌线

上海人工智能实验室报告显示,30B - A3B规模的SU - 01模型不依赖外部工具,经训练在IMO、USAMO、IPhO等奥赛评测达金牌水平。研究还验证更高效科学推理系统路线,有望用于更多科学问题。

机器之心
新闻资讯8

高盛怕了!Claude Mythos全球首个攻破企业网络,奥本海默时刻来了

英国AI安全研究所研究显示,Anthropic发布的Claude Mythos Preview模型在网络安全评估中表现惊人,能全自动、全自主完成企业网络攻击模拟。高盛为此加强网络防御,人类网络安全或进入奥本海默时刻。

新智元
开源动态8

探针伸进大模型黑箱,南加州大学华人团队打造AI记忆研究的深空望远镜

南加州大学 Robin Jia 教授团队借助英伟达算力,构建基于 Llama 3 架构的全开源受控大模型 Hubble,其成果将在 ICLR 2026 亮相。研究揭示大模型记忆机制效应,还评估了‘机器遗忘’技术,有法律应用潜力。

DeepTech深科技