「真实世界测试」共找到 2902 篇相关文章
“今天的OpenAI,就是昨天的Sun!” 杨立昆最新长谈:像Linux击溃微软一样,开源AI终将统治世界
图灵奖得主杨立昆在万字对话中阐述AI逆行逻辑,认为LLM非通向人类智能的道路,因其缺乏预测行动后果等能力。他离开Meta创立AMI Labs,专注世界模型和JEPA架构,还介绍Tapestry项目,主张开源AI将统治世界。
4 万星开源项目被指造假!MemGPT 作者开撕 Mem0:为营销随便造数据,净搞没有意义的测试!
高人气开源智能体记忆项目 Mem0 发布论文,称在 LOCOMO 测试打败对手。MemGPT 创始团队 Letta AI 联合创始人公开指控其造假,称测试无意义,自己轻松超其基准数据。二者都为解决大模型长期记忆问题而诞生。
极佳视界获新一轮亿元级 A1 轮融资,CEO:“物理世界 ChatGPT 时刻”将在 2 至 3 年内到来
近日,极佳视界完成新一轮亿元级 A1 轮融资,由华为哈勃、华控基金联合投资。该公司聚焦物理 AI,其创始人兼 CEO 黄冠博士称‘物理世界 ChatGPT 时刻’2 至 3 年内到来,世界模型技术价值已现。
刚刚,国产AI双冠王!黑马世界模型打破全球纪录,一镜到底封神
生数科技的MotuBrain零宣发登顶双榜,打通「看懂世界+执行行动」,适配多个头部机器人本体。它基于Motus进化,具备多本体、多任务、长程执行能力,展示出强大的「一脑多能」和「一脑多型」特点。
统一视觉多模态与多任务!快手可灵与港科大团队发布视频生成模型,加速真实世界理解
港科大、港中文、清华和快手可灵团队提出全新视觉框架UnityVideo,统一训练多种视觉模态,让模型更懂物理规律,视频生成更真实可控,还实现零样本泛化,在多任务表现优异。
具身智能“高考”难疯了!人类100分,最强模型12.8
原推出RoboTwin系列基准的团队带来RoboDojo,这是统一的仿真+真实世界机器人操作评测基准。它设42个仿真任务、18个真实任务,让30个主流策略竞技,结果显示机器人距通用操作差距大。
DeepMind 最新研究:智能体就是世界模型!
DeepMind研究科学家Jon Richens团队在ICML 2025发表论文,从第一性原理证明智能体就是世界模型,回答了AI界多年的根本问题,还带来多个有趣推论,引发AI社区热烈讨论。
迈向无缝共生:大模型GUI Agent的「屏幕图灵测试」与拟人化之路
多模态大模型使GUI Agent能模拟用户执行任务,但也引发与平台的利益冲突。论文提出“屏幕图灵测试”和AHB基准评估拟人化能力,探讨拟人化策略及权衡,为Agent在数字世界共生提供指南。
图灵也没想到,智能,必须在现实中「活」下来
第六届 ATEC 科技精英赛 ATEC2026 已开赛,由多单位共同组织。赛事聚焦人工智能、具身智能等方向,以真实世界挑战为命题,通过赛题设计检验系统在真实环境的运行能力,还设置丰厚奖励。
CrowdStrike联手Meta发布AI安全基准,让AI在真实网络攻击中证明自己
美国网络安全巨头CrowdStrike与Meta在Fal.Con 2025大会联合推出开源基准测试套件CyberSOCEval,旨在评估AI大语言模型在真实SOC环境下的网络安全能力,它源于Meta之前框架,开源供全球开发者使用。