「数据与评测基础设施」共找到 3249 篇相关文章
Grok 4基准测试被爆极其优异,人类终极考试成绩飙升到45%,碾压o3 和Gemini的20%
API开发者曝光Grok - 4和Grok - 4 Code测试成绩,HLE达35%,推理后飙升到45%,远超o3和Gemini的20%。其他测试也表现优异,但成绩引发争议,有人质疑数据污染,也有人支持,目前数据未官方证实。
“VLA和世界模型都不是终局,会有物理世界独有的模型” | 蚂蚁灵波沈宇军@AIGC2026
在2026中国AIGC产业峰会,蚂蚁灵波沈宇军与李根深度对话。沈宇军指出大模型踩中互联网数据红利,但机器人数据空白。他认为VLA和世界模型非具身智能终局,未来会有物理世界独有的模型。
极佳科技朱政:世界模型会进化成 VLA 的下一代|具身先锋十人谈
具身智能领域数据难题待解,极佳科技朱政投身世界模型研究。他认为世界模型短期内是‘驯化’VLA的容器,长期或与VLA融合。其团队成果显著,还将探索多维度建模与数据配比优化。
最强多模态模型也拿不到30分?DeepImageSearch定义相册搜索新范式,开启个人视觉记忆的深度搜索时代
人大窦志成教授团队联合OPPO研究院提出DeepImageSearch图像检索新范式,将其从“逐张语义匹配”推向“语料库级上下文推理”。团队构建评测基准DISBench,用ImageSeeker框架评测主流模型,结果显示最强模型单次完美解决查询比例不超三成。
第一视角效率超过真机,深度机智发布全球首个以人类学习范式构建的具身基座模型
2026年具身智能行业火热,但技术路线不明。深度机智创始人陈凯在中关村论坛发布具身智能基座模型PhysBrain 1.0,用千余小时人类第一视角数据超越真机数万小时数据成果,开启具身领域‘物理常识’革命。
讲座分享 | 密歇根大学Karthik Duraisamy教授
密歇根大学Karthik Duraisamy教授将开展讲座,主题为数据驱动的湍流建模。会介绍过去十年嵌入学习模型增强的进展,强调简约与约束平衡,指出存在的陷阱及挑战,还提及让数据驱动封闭成为可靠组件的要点。
0人类数据,让机器臂自学拧灯泡:MIT初创要打造机器人界的AlphaZero
Eka Robotics 发布机械臂视频,其能自主拧灯泡、抓取物品。该公司提出 VFA 模型,不依赖人类数据,让机器人在仿真环境自主探索。创始人期望实现超人级灵巧操作,算法还展现泛化和自主发明策略能力。
GPT-5.2首发评测:大神深度体验两周,强到离谱,但慢得抓狂
为对抗谷歌的Gemini 3,OpenAI推出GPT - 5.2。大神Matt Shumer深度评测,指出其指令遵循、代码生成、视觉和长上下文等能力有提升,但速度慢。与Claude Opus 4.5、Gemini 3 Pro各有分工。
机器人看不清,蚂蚁给治好了
天下苦机器人看不清透明和反光物体久矣,问题出在深度相机。蚂蚁集团具身智能公司蚂蚁灵波开源深度视觉模型LingBot - Depth,无需换硬件,用创新算法和大量数据提升性能,还将开源数据集。
章鱼动力再获5000万美元融资,以世界模型驱动「手脑一体」的物理 AI 基础设施
AI科技评论获悉,物理AI基础设施公司章鱼动力近日完成5000万美元融资,过去3个月累计融资近10亿。本轮由锦秋基金等领投,下轮5亿融资也接近完成。公司以SYNTH架构构建闭环,目标推动物理AI进阶。