「文本驱动动作生成」共找到 1298 篇相关文章
LaPha:你的Agent轨迹其实嵌入在一个Poincaré球?
经典强化学习动作空间离散有限,但语言模型动作空间几乎无限。上海科学智能研究院联合复旦大学提出LaPha,将智能体行为树映射到潜空间,构造密集奖励、剪枝等,在基准测试中效果显著。
Thinking with Video:一种全新的思考范式
在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。
首创TTFA指标!港大团队开源FASTER,让VLA模型真正实现「即刻响应」
港大团队提出FASTER,重新审视动作分块策略的反应延迟问题,提出快速动作采样方法。它即插即用,已开源。通过Horizon - Aware Schedule等创新,降低TTFA、提高闭环频率,实验显示能显著提升VLA反应能力。
脸谱心智陆弘远团队ACL 2026新作:别再给模型叠加「高级词」了!模型更爱听「大白话」
脸谱心智与香港中文大学科研人员中稿 ACL 2026 的新工作提出 Adam’s Law,即文本频率定律,揭示文本频率对模型训练及推理的重要性,还给出工程解法,实验效果显著,为行业带来新思路。
数字人视频革命!MultiTalk开源:15秒多人对话一键生成,歌唱/卡通全驾驭!
在AI驱动的视频生成领域,创建多人对话场景是难题。MultiTalk是开源音频驱动多人对话视频生成框架,由MeiGen - AI等联合研发,输入多路音频等就能生成嘴型同步的视频,适用于多种场景。
全球首款AI原生游戏引擎再进化:GTA6再不来,我们就AI一个
GTA 6跳票成梗,其场景常被用于研究。一个多月前全球首个AI原生UGC游戏引擎发布,如今Mirage迭代为更强大的Mirage 2,支持多样场景,与Genie 3有不同优势且已上线,不过仍有技术问题待解决。
比NotebookLM更好的「开源播客」,可根据多模态内容生成30分钟以上播客音频。
Podcastfy是开源Python工具,能把文本、图片等多模态内容,借生成式AI转化为播客。它支持自定义,适配多种语言和文本转语音模型,能生成2 - 5分钟或30分钟以上的播客,使用体验比NotebookLM好。
JCP | 哈工大(深圳)胡钢团队:三维钝体流动中主动流动控制的深度强化跨域迁移学习
本文将基于相互信息的知识迁移学习与柔性动作 - 评论(MIKT - SAC)算法结合,解决主动流动控制中状态和动作维度的跨领域问题。应用于两个测试案例,结果显示该方法优于SAC算法,能显著减少训练时间、降低阻力系数。
给机器人一个会预测未来的Critic,VLA强化学习直接起飞
OpenMOSS团队开源的World Critic Model(WCM),解决了视觉 - 语言 - 动作模型强化学习(VLA - RL)中批评家模型(Critic Model)仅依赖单帧观测打分的问题。WCM让Critic学习预测执行动作后的潜在状态,代码等全开源,验证效果显著。
AI 增强截图项目,爽歪歪~
日常截图后手动处理文字、公式、表格耗时又易出错。开源项目`Snippai`将截图与智能分析融合,是跨平台智能截图工具,能自动识别内容类型并处理,有多种功能,安装使用简单。