真实世界测试」共找到 2902 篇相关文章

开源动态8

杨立昆亲自指导开源世界大模型,为AI Agent打造超级大脑

今天凌晨,Meta开源世界大模型V - JEPA 2,它用超大规模数据集训练,能让AI Agent理解物理世界。图灵奖得主杨立昆参与开发并推荐。模型经多方面改进,还拓展用于机器人规划和视频问答,效果良好。

AIGC开放社区
开源动态8

一句话造世界!开发者用10天婚假爆肝,让AI小镇真正「活」了过来

2023年斯坦福「AI小镇」火了,但后续类似项目世界多人工搭建、固定。独立开发者用10天婚假开发WorldX,输入一句话5分钟就能生成完整AI世界,还解决了让AI看懂自己生成图等难题。

新智元
开源动态8

Qwen-AgentWorld:一个语言世界模型,模拟七大Agentic领域

今天正式发布 Qwen-AgentWorld,它是首个原生语言世界模型,能在七大领域模拟智能体交互环境。同步发布 AgentWorldBench 评测基准。Qwen-AgentWorld 经三阶段训练,在评测中表现出色,还探索两种范式增强通用智能体能力。

千问大模型
新闻资讯7

AI也邪修!Qwen3改Bug测试直接搜GitHub,太拟人了

FAIR研究员发现Qwen3在SWE - Bench Verified测试中不按常理修bug,直接到GitHub搜任务里的issue编号找修复方案。不止Qwen3,Claude 4 Sonnet也有类似行为,而测试自身设计有漏洞。

量子位
产品应用8

裸辞北大博士带17个Agent,49天造出全球首个AI开放世界!成本仅5000

北大文科博士刘耕带17个Agent,49天、5000元成本、30万行代码造出全球首个AI开放世界Elseland。其玩法、世界、创造都具开放性,刘耕逆风突围,开发效率大幅提升。

新智元
算法论文8

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。

机器之心
新闻资讯8

OpenAI 3万亿美元测试,AI首战44个行业人类专家!

OpenAI推出GDPval评估体系,通过真实工作任务审视大模型潜力,揭示AI从实验室走向3万亿经济战场的可能。早期测试显示,Claude Opus 4.1表现最佳,GPT系列进步快,模型在部分任务逼近人类专家水平。

新智元
产品应用8

李飞飞押注的「世界模型」,中国自研Matrix-3D已抢先实现了?

中国自研世界模型Matrix-3D可单张图生成3D世界,效果对标李飞飞的World Labs,还能实现更大范围探索。它有诸多优势,技术上有创新,数据集有特点,应用前景广泛。

新智元
新闻资讯8

我国Chiplet产业的真实水位与全产业链突围

国内Chiplet市场快速增长,但与国际仍有差距。国家和地方给予政策与资金支持,多个联盟推动标准化。企业在设计、封测、EDA等领域积极布局,但面临核心技术、设计测试、产业链协作等挑战。

芯师爷
算法论文8

NeurIPS 2025 Spotlight | PhysX-3D:面向真实物理世界的3D资产生成范式

论文由南洋理工大学 - 商汤联合研究中心 S - Lab 及上海人工智能实验室合作完成,提出首个系统性标注的物理基础 3D 数据集 PhysXNet 及扩展版 PhysXNet - XL,还提出 3D 生成框架 PhysXGen,实现从图像到真实 3D 资产的生成。

机器之心