「视频 - 音频联合生成」共找到 2051 篇相关文章
句子级溯源+生成式归因,C²-Cite重塑大模型可信度
在人工智能发展背景下,大模型内容可信度成焦点。北邮百家AI与小米团队提出溯源大模型C² - Cite,首创上下文感知归因生成技术,解决现有归因模型缺陷,已被WSDM 2026收录。
RLinf上新πRL:在线强化学习微调π0和π0.5
近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。
全新SkyReels发布,昆仑万维要通吃创意生态 | 甲子光年
11月4日,昆仑万维发布全新SkyReels,定位“一站式、零门槛多模态AI创意平台”。它有无限画布、智能副驾、AI视频模板三大革新,重构创作流程。其技术进化快,还加入平面设计功能,有望撬动更大应用市场。
极佳视界获新一轮亿元级 A1 轮融资,CEO:“物理世界 ChatGPT 时刻”将在 2 至 3 年内到来
近日,极佳视界完成新一轮亿元级 A1 轮融资,由华为哈勃、华控基金联合投资。该公司聚焦物理 AI,其创始人兼 CEO 黄冠博士称‘物理世界 ChatGPT 时刻’2 至 3 年内到来,世界模型技术价值已现。
我给在上学的弟弟做了个论文版抖音
作者弟弟被海量论文困扰,作者为其做了像刷短视频一样刷论文的工具,用了 Claude Code 和星辰 Agent 社区版,还介绍了系统逻辑、搭建过程,对比了不同平台,最后工具开源,鼓励按需改进。
社区供稿丨Hugging Face创始人 x 小红书技术副总裁:关于开源、AI与技术人成长
今年1024程序员节,小红书技术副总裁凯奇、语音模型技术负责人风龙与Hugging Face联合创始人Thomas Wolf深度对谈。围绕AI Coding、开源、AGI等核心观点展开,探讨开源闭源、AGI未来、AI人味及个人能力等话题。
港科提出新算法革新大模型推理范式:随机策略估值竟成LLM数学推理「神操作」
香港科技大学联合团队提出 ROVER 算法,跳过传统强化学习推理的策略迭代循环。它在多项数学推理基准上超越现有方法,在高难度任务中大幅提高 pass@1 和 pass@256,且提升推理多样性,更轻量。
首个实例理解3D重建模型!NTU&阶越提出基于实例解耦的3D重建模型,助理场景理解
人类能自然感知3D世界的几何与语义,但AI做到“两者兼得”是挑战。NTU联合StepFun提出IGGT,将空间重建与实例级上下文理解融为一体,还构建了InsScene - 15K数据集,解决了传统方法的问题。
NeurIPS 25 | 中大&UC Merced等开源RAPID Hand,重新定义多指灵巧手数据采集
来自多机构研究者联合提出全新开源高自由度灵巧手平台 RAPID Hand。它能解决硬件瓶颈问题,实现稳定、高质量数据采集。其软硬协同优化,在操作表现与稳定性上优于现有方法,还具备低成本等优势。
27亿美元天价回归!谷歌最贵「叛徒」、Transformer作者揭秘AGI下一步
在Hot Chips 2025上,Transformer发明者之一、谷歌Gemini联合负责人Noam Shazeer指出LLM发展需更多算力、内存等硬件支持。微软AI的CEO Mustafa Suleyman预测2026年底前LLM或成“行动型AI”,还提及失业潮等问题。