视频一致性」共找到 1076 篇相关文章

新闻资讯8

谷歌AI核爆:升级全系模型,Gemini 2.5双榜登顶!所有产品用AI重做,OpenAI如何接招?

北京时间5月21日凌晨,谷歌在2025 I/O大会发布众多更新。模型层面,为Gemini 2.5 Pro引入新推理模型和2.5 Flash;谷歌搜索推出AI模式;还亮相视频模型Veo 3,编码助手Jules公测等。

AI前线
算法论文8

Reasoning的最终答案可能不是模型想要的答案!

大型语言模型解决复杂问题有推理过程和答案,传统评估只看最终答案。论文提出最终答案可能不佳,中间步骤更值得研究。还介绍通过切割推理过程发现中间步骤藏玄机,提出‘分步检查法’提升模型表现,实验表明准确率最高提升13%等。

深度学习自然语言处理
新闻资讯7

GPT-6 Astra:欢迎来到 AGI 时代。

OpenAI 发布 GPT - 6 Astra,总裁称开启 AGI 时代。演示视频展示其强大并行处理能力,跑分有争议,成绩不一。它有诸多成果和安全表现,也有可监控性降低问题,发布过程却状况百出。

AGI Hunt
开源动态8

全球首个!10万小时人类数据全开源,Hugging Face罕见站台

上周Dyna Robotics公司用超100万小时人类第一视角视频训练DYNA - 2模型,发现物理AI有Scaling Law。8月20日光轮智能宣布10万小时全模态人类行为数据EgoSuite - Open100K开源,与Hugging Face联合发布。

新智元
算法论文8

不再止步于自然语言!PhiZero让世界模型学会「物理语言」

PhiZero由中科院自动化所团队研发,探索让AI读懂真实世界运动、交互与变化的“物理语言”。它构建Reason - then - Render框架,经大量数据训练,在多基准测试中表现领先,为AI理解物理世界开辟新通道。

机器之心
算法论文8

CVPR 2026 三维视觉趋势梳理:从 RGB 感知,到真实世界建模

计算机视觉行业从追求识别能力转向关注视觉系统对真实世界的理解。CVPR 2026研究中,多视角、事件视觉、开放集3D生成和相机运动轨迹被引入视觉理解,多篇论文从不同侧面推动视觉系统走向对真实世界的理解。

AI科技评论
产品应用7

抢先李飞飞!世界模型能多人联机玩FPS游戏了

Odyssey公司推出世界模型Agora - 1,驱动网页版多人FPS游戏,无游戏引擎等,画面实时生成。该公司专注通用世界模型,此前业务转向主动交互,此成果解决多人游戏一致性难题,还发布多模态模型Starchild - 1。

量子位
新闻资讯7

干掉 .md?兜里 Token 不够,没法和 Karpathy 共情

近日,围绕‘Markdown 是否已过时’讨论升温。Theo Browne 视频阐述‘HTML 优于 Markdown’五大理由并分享实操技巧,虽指出 HTML 有费 Token、版本控制差问题,但仍倾向用 HTML,不过也有开发者质疑。

InfoQ
新闻资讯7

ChatGPT和Claude争了个寂寞!用户重叠仅11%,中国应用霸榜移动端

风投机构a16z发布“迄今最受消费者喜爱的Top100 AI应用”榜单。前50个移动AI应用近半来自中国团队,用户多在海外。ChatGPT领先但挑战者来势汹汹,其与Claude用户重叠仅11%,全球形成三大AI市场。

量子位
开源动态8

国产模型开源封神,谷歌Genie3紧急开源?蚂蚁AGI撕开世界模型闭源防线

蚂蚁灵波发布开源SOTA级世界模型LingBot - World,全面对标谷歌Genie 3,部分性能指标超越。它有高保真、长视频生成等优势,还能解决具身智能痛点,发布后引发海外关注,促使Genie将开源。

新智元