「第一视角交互」共找到 1075 篇相关文章
ICLR 2026|在「想象」中进化的机器人:港科大×字节跳动Seed提出WMPO,在世界模型中进行VLA强化学习
香港科技大学 PEI - Lab 与字节跳动 Seed 团队提出 WMPO 新范式,可让具身智能在‘想象中训练’,解决传统 VLA 训练瓶颈,目前论文、代码与模型均已开源。
一天两枚“代码核弹”:OpenAI 祭出首个“主打实时协作”的 Codex 模型,谷歌放出 Gemini Deep Think,码力冲到世界前8
OpenAI 发布 GPT - 5.3 - Codex - Spark 研究预览版,专为实时编码设计,降低交互延迟。谷歌更新 Gemini 3 Deep Think,面向科研与工程难题,在多领域测试表现出色,二者引发网友热议。
马斯克深夜点赞!内容的下一站是:玩!
马斯克深夜点赞用 Loopit 制作的互动 meme,引发关注。Loopit 让用户体验从‘看’变‘玩’,实现双向交互。其融合 AI Coding 与多模态生成,构建 Runtime,解决延迟、状态同步等问题,潜力大。
灭霸带着复联放烟花!16秒,让手搓 AI 视频拥有大片即视感
生数科技的Vidu Q3超越Sora 2,位居全球第二、中国第一。它能16秒声画同出、叙事能力强、镜头和文字渲染出色,还降低了视频制作门槛,可用于漫剧、短剧、影视剧制作。
完全取代Claude Code?OpenAI反击来了,推出Codex app「限时免费使用」
OpenAI推出macOS版Codex应用,反击Claude Code。它有全新交互界面,助开发者管理多AI Agents,支持并行任务。限时内,ChatGPT部分用户可免费使用,速率限制有调整,还具备多种新特性。
AI 驱动的智能异常处置:从异常发现到根因定位
在 2025 年 QCon 全球软件开发大会(北京站)上,阿里云算法专家张颖莹分享《AI 驱动的智能异常处置:从异常发现到根因定位》。她介绍阿里云计算平台运维挑战,给出算法选型与设计思路,还提及后续平台建设规划。
为什么自监督永远学不到语义?
《Visual Language Hypothesis》论文用纤维丛理论审视视觉表征学习,指出只做连续变换难触达语义。分析现有无监督学习不足,提出“Expand - and - Snap”机制,还通过实验验证,提供审视AI架构新视角。
一个超级搜索Agent开源,超低成本拉满搜索推理能力!小参数、慢思考。
MiroThinker 1.5发布,打响2026年AI模型进步第一枪。它以小参数实现高性能,解决信息雾霾、AI幻觉、决策无力等问题,通过交互式扩展和时序敏感训练沙盒技术,展现强大搜索推理能力。
《三体》“宇宙闪烁”成真!免佩戴裸眼3D屏登Nature
中国团队出品的显示屏EyeReal登上Nature,无需佩戴眼镜就能把3D画面精准投射到眼中。它尺寸小、成本低,融合计算光学与AI,解决了以往裸眼3D技术难题,画面流畅且解决“晕3D”问题。
西湖大学修宇亮,想做「会格斗的数字人」丨GAIR 2025
2025年12月12 - 13日,第八届GAIR全球人工智能与机器人大会将在深圳举办。西湖大学助理教授修宇亮12月13日将在《世界模型》论坛演讲,带来数字人研究最新成果,其曾破局三维数字人姿态重建难题,还想做“会格斗的数字人”。