模长感知」共找到 953 篇相关文章

开源动态7

OpenClaw低调更新重磅版本,龙虾脚了

OpenClaw开发者Peter带来Computer Use工具Peekaboo v3版本,解决了Agent类产品无法直接操控桌面的问题。它能实现像素级截图、读取UI位置,还能完成各类操作,支持自然语言指令,有四种使用方式。

量子位
推荐文章8

通用Agent啥样

视频探讨大厂做基于命令行编程工具的原因,介绍命令行Agent,剖析其等于庞大工具生态、经典Unix组合哲学与现代AI调度能力,指出通用Agent骨架由AI大脑、命令行身躯和MCP感官构成。

newtype AI
算法论文8

西湖大学张驰团队:不重训,也能让视频生成更更稳丨CVPR 2026

AI 视频生成目前存在视频稳定性问题,西湖大学张驰团队提出 《Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction》。研究表明 FreeLOC 方法能提升视频生成质量,且具跨型通用性,还揭示了问题机制,降低算力成本。

AI科技评论
新闻资讯7

Gemini 2.5 Pro 负责人:最强百万上下文,做好了能解锁很多应用场景

谷歌DeepMind上下文预训练联合负责人Nikolay Savinov在播客中分享Gemini 2.5上下文技术。他认为上下文能革新产品交互,与RAG协同,未来千万级token上下文将成标配,但当前百万级未达完美时扩规意义不大。

Founder Park
产品应用7

GPT5.5 + Codex 如何跑一整夜,编程的下一步,不是辅助编程,是可托管执行单元

文章指出GPT - 5.5在Codex里展现出强大自主性,能处理时程任务。还介绍让其跑任务的方法及面临的问题,强调任务需状态机、证据链等,社区也在构建相关工作流层。

AI进修生
开源动态7

视频会议纪要、访谈节目精剪AI神器

WhisperVideo是用于篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。

GitHubStore
推荐文章7

“Skill 不就是一点的提示词吗?”

文章回应了对'skill是提示词'的质疑,指出差异在于提示词配套的是ChatBot还是Agent。ChatBot只能对话,Agent能调用工具干活。Skill可渐进加载,具可复用、组合、迭代等优势,是提示词工程化封装。

宝玉AI
算法论文8

视频生成一就漂移竟是前序帧「太干净」惹的祸!研究揭示共享噪声水平才是视频稳定关键

自回归视频生成型存在训推不一致导致的误差累积问题,使生成视频越往后越易出现时序漂移和画面崩坏。HiAR团队推出HiAR,通过共享噪声水平减少误差传递,还解决了动作僵化问题,实现分钟级无退化生成。

量子位
算法论文8

「听觉」引导「视觉」,OmniAgent开启全态主动感知新范式

针对端到端全态大型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源型。

机器之心
算法论文8

无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案

近年来,视觉 - 语言型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。

机器之心