「人机情感交互」共找到 854 篇相关文章
告别「一条路走到黑」:通过自我纠错,打造更聪明的Search Agent
为解决知识实时性和推理复杂性挑战,搜索智能体(Search Agent)应运而生,但缺乏自我纠错能力。腾讯联合清华提出 ReSeek 框架,引入动态自我修正机制,还构建 FictionalHot 数据集评估,实验效果良好。
32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成
字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。
李飞飞最新长文:AI的下一个十年——构建真正具备空间智能的机器
李飞飞发表长文《From Words to Worlds: Spatial Intelligence is AI’s Next Frontier》,解读空间智能,阐述构建具备空间智能机器的核心框架,探讨其应用场景,认为这是AI下一个前沿。
世界模型==VQA?机器人不用想象画面,预测语义就够了
华盛顿大学、索尼AI研究者在新论文中质疑机器人世界模型是否需想象精确未来画面。指出多数模型还原画面不适合决策,提出语义世界模型SWM,能预测未来语义信息,实验效果良好。
AI 创业最大的问题,不是 FOMO,而是没想清楚
Anthropic 对齐研究负责人 Jordan Fisher 在 YC 分享中提出诸多 AI 创业思考,如按两年后世界规划产品、软件是否商品化、信任问题及护城河等,虽当下多无答案,但思考很重要。
微软公开预览可充当 MCP 服务器的 Logic Apps
微软宣布 Azure Logic Apps(标准版)公开预览新功能,可充当 MCP 服务器,为开发者构建和管理代理提供灵活方式。MCP 是开放标准,让 LLM、AI 代理等与外部系统交互,此功能好处多。
字节发了个机器人全能大模型,带队人李航
字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。
Figure人形机器人首秀灵巧手叠衣服!神经网络架构不变,只增加数据集就搞定
Figure人形机器人首秀用灵巧手叠衣服,在未改变神经网络架构、仅增加数据的情况下,让原本用于物流场景的它习得新技能,完成了端到端的操作,还实现自然多模态交互。
推理路径的动态调控:让大模型学会“恰到好处”的思考
当前大模型推理路径存在冗余问题,本文提出测试时提示干预框架PI(π),通过《When/How/Which》三模块协同,将人类专家经验融入推理过程,在多个STEM基准测试中缩减推理步骤、提升准确率。
打破传统游戏逻辑!Google | 提出Concordia ,通过Mutil-Agent构建游戏引擎!
Google DeepMind和多伦多大学研究人员提出Concordia软件库,用AI驱动智能体担任GM,基于「实体 - 组件」架构,让工程师和设计师分工,可灵活构建复杂游戏场景,还支持不同交互动态和多种使用动机。