「视觉框架」共找到 2192 篇相关文章
SeeDance 2.5:AI 一次能出 30 秒视频,被重新定价的是这几层人
7 月初,字节在火山引擎 FORCE 大会上放出 SeeDance 2.5,它能一次性生成 30 秒完整成片。文章详述其能力,提出视频生成的不可能三角判断框架,还分析它会重新定价产业链上多个环节,改写产出随机性。
从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用
近年来大语言模型在长篇视觉叙事中潜力卓越,但长视频剪辑仍难控制。中科大等团队开源工作从系统工程视角研究多模态智能体在长视频编辑中的机制,重构剪辑管线,找到症结并给出解决办法。
手机跑多模态也能快到飞起!面壁MiniCPM-V 4.6开源
面壁智能开源多模态模型MiniCPM-V 4.6,以低算力成本、超低首Token延迟打通三大主流手机操作系统。它算力瘦身性能强,是视觉语言多面手,还适配主流系统,降本增效,让AI能力从云端到指尖。
既要安全⼜要弹性,理想汽车如何解开企业 OpenClaw 落地死结|甲子光年
2025年以来,大模型应用飞速发展,以OpenClaw为代表的开源框架是变革催化剂,但其在企业级生产环境有缺陷。理想汽车以阿里云ACS Agent Sandbox及ACK为核心,为Agent构建专属‘沙箱’,解决落地难题。
ACL 2026|Doc-V*:读100页文档不如只翻对5页,80页场景「暴打」RAG 10个点
Doc-V*由小米和华中科技大学团队提出,是多页文档理解新范式,通过交互式视觉推理让模型有策略地读长文档。它在多页文档问答基准上比RAG变体提升49.7%,不依赖大模型或长上下文窗口。
AI的窗口期还剩多久,不同窗口处于什么阶段?战略上车来得及吗
文章指出AI窗口期并非单一窗口,而是一组接力出现的窗口。分析了基础设施投资、AI人才、AI应用创业等五个维度的窗口期阶段,给出识别窗口期的框架,还为普通人抓住窗口期提供了实操策略。
诺奖得主实验室走出的中国团队,正用世界模型重构生命分子设计
过去 AI 分子设计多困于‘模态孤岛’,难以跨模态理解和设计。诺奖得主实验室走出的中国团队推出 ODesign 开源项目,将多模态分子纳入统一框架,展现跨模态迁移能力,团队创立英灵殿科技欲重构药物研发流程。
全球首个世界统一模型发布,机器人家庭成员来了!
自变量机器人发布全球首个世界统一模型架构的具身智能基础模型WALL - B,它打通视觉、听觉等模块,让机器人理解物理世界。还让机器人拥有多能力,通过真实家庭数据形成数据飞轮,助力其融入家庭。
Demo秀终结,机器人连干8小时不歇!智元定义「部署态」
4月17日智元合作伙伴大会上,智元创始人定义2026为「部署态」元年,即机器人在真实场景7×24小时自主干活。大会首提XYZ曲线产业发展框架,还发布七大生产力解决方案,展示四大新本体、六大AI模型等成果。
CVPR2026 | Streamo:让大模型变成实时流式交互助手
香港浸会大学联合腾讯优图实验室提出 Streamo,将‘何时回答’变为模型预测的 token,通过端到端训练框架把离线视频模型转化为实时流视频助手,还构建 Streamo - Instruct - 465K 数据集,实验效果良好。