「动态视觉伺服系统」共找到 994 篇相关文章
创新常常发生在无人走过的路上|5Y News Monthly
「5Y News Monthly」回顾五源及被投企业新闻动态。被投企业有投融资、合作、新品发布等大事,如极壳完成7000万美元融资,月之暗面发布Kimi K2 Thinking模型。五源也有荣誉、观点分享等动态。
19K star 霸榜,下一代的浏览器自动化神器!
做爬虫或Web自动化测试常因网页结构变动需重写脚本。Github上超火的Skyvern项目是基于浏览器的自动化代理,不依赖XPath或CSS选择器,用视觉识别结合大模型推理完成任务,已获19k+ star。
7B打败o3、GPT-5!医学AI智能体让模型学会“看哪里、怎么看”
上海创智学院LeapQuest团队联合多校,在ICML 2026接收两篇论文,提出“Think with Images/Think with Videos”范式,让视觉证据参与模型推理,Ophiuchus和MedScope分别用于图像和视频诊断,表现出色。
打破碎片化瓶颈!浙大&哈佛开源UniGeo,高保真相机可控编辑
当前主流相机可控图像编辑基于图像扩散模型,应对连续相机运动易出现问题。近日,浙大联合哈佛发布UniGeo框架,在三核心层面注入统一几何引导,克服结构退化,提升视觉质量与跨视角一致性。
OpenClaw安全有救了!不改内核、无视AI内部逻辑,数学级枷锁驯服暴走智能体
OpenClaw等智能体能力强大但有安全黑洞,南方科技大学和香港科技大学团队推出ClawLess框架,从底层系统调用源头扼杀智能体出格行为,通过形式化验证、物理隔离、动态验证等手段保障安全。
告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式
传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决长视频生成难题,技术已开源。
社交Agent: 通过RL学习自适应Thinking,根据场景在“秒回”和“深思”间灵活切换
现有聊天机器人在人情世故场景表现不佳,论文指出大模型思维‘一根筋’。研究团队设计4种思维模式,用AMPO强化学习算法动态切换。在模拟社交任务中,AMPO表现超GPT - 4,省时高效。
递归神经网络的复兴:Mixture-of-Recursions
Google DeepMind研究者设计的语言模型,能判断关键单词并进行深度递归计算,通过轻量级“路由器”节省计算资源,在同等训练成本下表现显著优于传统模型,文中还提及其他解决动态算力分配问题的思路。
ACL 2026 Main|混合推理模型也会「钻空子」:南大移动团队提出TNT,破解「假装不思考」骗奖励
大型推理模型存在「过度思考」问题,训练混合推理模型易出现奖励欺骗。南大等团队提出 TNT 方法,利用思考模式解答部分为问题动态设非思考模式 token 上限,解决奖励欺骗,实现准确率与效率双赢。
刷榜自动驾驶语义场景补全!北大新作:高维度、高密度 | AAAI'26
北京大学彭宇新教授团队提出视觉语义场景补全方法HD² - SSC,通过高维度语义解耦和高密度占用优化,解决现有技术维度与密度差异问题,在两自动驾驶数据集上取得最优性能。