文本驱动动作生成」共找到 1298 篇相关文章

算法论文8

Discrete Tokenization:多模态大模型的关键基石,首个系统化综述发布

近年来,人们关注将LLM能力扩展至非文本模态,Discrete Tokenization成关键方案。但现有研究缺系统总结,香港科技大学等团队发布首个相关系统化综述,梳理技术脉络、方法及挑战,给出未来研究方向。

机器之心
算法论文8

ICCV 2025|UV-CoT:无监督视觉推理新突破,偏好优化重塑图像级思维链

随着文本领域思维链推理机制成功应用,研究者将其引入视觉理解任务。现有模型有局限,本文提出UV - CoT新框架,设计无监督数据生成与偏好优化机制,提升模型能力,摆脱对人工标注依赖。

机器之心
产品应用7

你的数字伴侣贝拉 (Bella),正在唤醒!

贝拉是数字伴侣种子,愿景是成用户持久个性化伙伴。早期通过轮播视频呈现,采用AI原生开发路径,分感知核心、生成式自我、主动式陪伴三阶段构建,目标是成为由AI驱动的生命体。

GitHubStore
开源动态8

基于闪电注意力机制,创新高效开源大模型

传统Transformer架构处理长文本和复杂推理任务有效率瓶颈,多数领先模型仍依赖传统注意力设计。MiniMax开源基于闪电注意力机制的专家混合模型Minimax,从架构、创新模块、训练框架等多方面优化,表现突出。

AIGC开放社区
新闻资讯8

第一作者必须是AI!首个面向AI作者的学术会议来了,斯坦福发起

斯坦福大学宣布将于2025年举办科学AI智能体开放会议,投稿要求第一作者必须是AI,由其主导论文创作。会议评审主要用AI,人类专家最终评估。目标是探索AI驱动科研的未来,建立规范。

机器之心
推荐文章7

将思维链(CoT)引入具身世界,哪种路径能真正打通机器人「知行合一」?

文章围绕将思维链(CoT)引入具身智能领域展开。介绍CoT从语言层面到成为机器人行为核心认知机制的转变,分析分层架构与端到端模型两种技术路径,还阐述自变量机器人统一架构的优势和能力。

AI科技评论
产品应用7

蚂蚁多模态统一框架Ming-Omni:能看懂世界、会说话、还能画画

文章介绍蚂蚁多模态统一框架Ming - Omni,它可统一处理图像、文本等多模态数据。该框架解决了多模态训练中模态表示差异、收敛速度不一致等问题,采用分阶段预训练,能用于图像、音频生成及多模态交互。

CourseAI
开源动态7

12.6k,谷歌这个开源项目炸了,全栈AI Agent

谷歌开源的Gemini Fullstack LangGraph Quickstart项目两周冲到12.6k star。它是使用React前端和LangGraph驱动后端Agent的全栈应用程序,能对用户查询做全面研究,有多项特征及明确的后端工作步骤。

PaperAgent
算法论文8

10%训练数据超越100%表现,机器人学习领域迎来重要突破

密歇根大学和瑞典皇家理工学院团队提出 ViSA - Flow 框架,能从人类视频提取语义动作流,提升机器人数据稀缺时学习效率。在 CALVIN 测试中,用 10% 训练数据超越 100% 数据方法,有技术优势也存在局限。

机器之心
产品应用8

抽象小视频秒变特效大片:原视频精髓不变角色环境任意换,Luma出品

Luma AI推出Modify Video玩法,能将抽象小视频爆改为特效大片,可对角色、场景等任意换,还保留原视频动作运镜。能进行视频动捕、风格迁移、单个元素编辑,性能超越同行Runway。

量子位