「视频学习」共找到 2297 篇相关文章
GPT-6 Astra:欢迎来到 AGI 时代。
OpenAI 发布 GPT - 6 Astra,总裁称开启 AGI 时代。演示视频展示其强大并行处理能力,跑分有争议,成绩不一。它有诸多成果和安全表现,也有可监控性降低问题,发布过程却状况百出。
全球首个!10万小时人类数据全开源,Hugging Face罕见站台
上周Dyna Robotics公司用超100万小时人类第一视角视频训练DYNA - 2模型,发现物理AI有Scaling Law。8月20日光轮智能宣布10万小时全模态人类行为数据EgoSuite - Open100K开源,与Hugging Face联合发布。
不再止步于自然语言!PhiZero让世界模型学会「物理语言」
PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。
又一位xAI联创宣布创业,押注开源模型和个人AI,融资11亿美元
8月11日,xAI联合创始人伊戈尔·巴布什金创办的River AI完成11亿美元融资。该公司6月成立,团队约20人,刚公开首个产品River API。巴布什金想让企业和个人拥有自己的AI,目前先从企业需求切入。
CVPR 2026 三维视觉趋势梳理:从 RGB 感知,到真实世界建模
计算机视觉行业从追求识别能力转向关注视觉系统对真实世界的理解。CVPR 2026研究中,多视角、事件视觉、开放集3D生成和相机运动轨迹被引入视觉理解,多篇论文从不同侧面推动视觉系统走向对真实世界的理解。
干掉 .md?兜里 Token 不够,没法和 Karpathy 共情
近日,围绕‘Markdown 是否已过时’讨论升温。Theo Browne 视频阐述‘HTML 优于 Markdown’五大理由并分享实操技巧,虽指出 HTML 有费 Token、版本控制差问题,但仍倾向用 HTML,不过也有开发者质疑。
Generalist之后,罗剑岚团队推出LWD,也要变革具身智能训练范式
智元机器人与上海创智学院联合发布全新具身智能训练范式 LWD,可让机器人在真实世界部署中持续自主改进。它打破传统 AI 静态模式,构建数据飞轮,在四大维度创新,经测试表现出色,或成具身智能转折点。
一分钟的奇迹与幻觉:实测世界模型Happy Oyster
4月16日阿里发布世界模型Happy Oyster,支持多模态输入与音视频联合生成。实测显示,它在场景构建、渲染上有优势,可替代部分传统引擎工作,但存在一致性不足问题,现阶段更适合改造游戏开发流程。
人形机器人「网球运动员」来了!不靠预编程,银河通用×清华破解长程打网球难题
银河通用与清华联合提出LATENT研究,使人形机器人通过深度强化学习自主习得网球对打能力,实现从“机械复刻”到“智能决策”跨越。该研究提出新运动学习方法,构建“运动小脑”等,经实验验证性能优越。
ChatGPT和Claude争了个寂寞!用户重叠仅11%,中国应用霸榜移动端
风投机构a16z发布“迄今最受消费者喜爱的Top100 AI应用”榜单。前50个移动AI应用近半来自中国团队,用户多在海外。ChatGPT领先但挑战者来势汹汹,其与Claude用户重叠仅11%,全球形成三大AI市场。