「模长感知」共找到 953 篇相关文章
OpenClaw低调更新重磅版本,龙虾长手长脚了
OpenClaw开发者Peter带来Computer Use工具Peekaboo v3版本,解决了Agent类产品无法直接操控桌面的问题。它能实现像素级截图、读取UI位置,还能完成各类操作,支持自然语言指令,有四种使用方式。
通用Agent长啥样
视频探讨大厂做基于命令行编程工具的原因,介绍命令行Agent,剖析其等于庞大工具生态、经典Unix组合哲学与现代AI调度能力,指出通用Agent骨架由AI大脑、命令行身躯和MCP感官构成。
西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026
AI 视频生成目前存在长视频稳定性问题,西湖大学张驰团队提出 《Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction》。研究表明 FreeLOC 方法能提升长视频生成质量,且具跨模型通用性,还揭示了问题机制,降低算力成本。
Gemini 2.5 Pro 负责人:最强百万上下文,做好了能解锁很多应用场景
谷歌DeepMind长上下文预训练联合负责人Nikolay Savinov在播客中分享Gemini 2.5长上下文技术。他认为长上下文能革新产品交互,与RAG协同,未来千万级token上下文将成标配,但当前百万级未达完美时扩规模意义不大。
GPT5.5 + Codex 如何跑一整夜,编程的下一步,不是辅助编程,是可托管执行单元
文章指出GPT - 5.5在Codex里展现出强大自主性,能处理长时程任务。还介绍让其跑长任务的方法及面临的问题,强调长任务需状态机、证据链等,社区也在构建相关工作流层。
长视频会议纪要、访谈节目精剪AI神器
WhisperVideo是用于长篇幅、多说话人视频的简洁演示系统,专为真实对话构建。它有SAM3视频分割、TalkNet主动说话人检测等功能,具备视觉关联说话人归属等特性,文中还介绍了安装、运行等内容。
“Skill 不就是长一点的提示词吗?”
文章回应了对'skill是长提示词'的质疑,指出差异在于提示词配套的是ChatBot还是Agent。ChatBot只能对话,Agent能调用工具干活。Skill可渐进加载,具可复用、组合、迭代等优势,是提示词工程化封装。
视频生成一长就漂移竟是前序帧「太干净」惹的祸!研究揭示共享噪声水平才是长视频稳定关键
自回归视频生成模型存在训推不一致导致的误差累积问题,使生成视频越往后越易出现时序漂移和画面崩坏。HiAR团队推出HiAR,通过共享噪声水平减少误差传递,还解决了动作僵化问题,实现分钟级无退化生成。
「听觉」引导「视觉」,OmniAgent开启全模态主动感知新范式
针对端到端全模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型。
无需训练,如何提升黑箱VLM?CARPRT用「类别感知」给出答案
近年来,视觉 - 语言模型(VLMs)改变图像理解范式,但零样本分类性能对 Prompt 敏感。墨尔本大学 TMLR 小组提出 CARPRT 方案,以“无训练、黑箱适配、类别专属权重”解决提示词语义适配不足问题,已被 ICLR 2026 接收。