多模态视觉作品」共找到 1467 篇相关文章

新闻资讯7

万字总结:如何练就适配人形机器人的可靠「灵巧手」?|GAIR Live

在具身智能崛起时,灵巧手成人工智能落地核心突破口。2025年5月25日相关线上沙龙中,嘉宾围绕灵巧手软硬件、数据与模型、落地应用等交流,探讨数据难题、开源价值、落地挑战及中美差距等。

AI科技评论
算法论文8

世界模型迎来因果升级:CD-LAM仅用几千步微调即可显著增强动作控制

Aether AI与加州大学圣地亚哥分校研究发现现有世界模型会无视动作控制信号,根源是隐动作模型受视觉混杂因素污染。团队提出CD - LAM,从上游净化隐动作表征,实验显示其能降动作误差、提画面质量,降低后训练开销。

机器之心
新闻资讯8

Jeff Dean最新访谈:未来开发者人均50个智能体,写需求成核心技能

谷歌首席AI科学家Jeff Dean在访谈中预言,未来开发者人均管理50个智能体,写需求成核心技能。他还揭秘谷歌帕累托前沿策略,介绍蒸馏技术让小模型接近大模型性能,强调多模态及低延迟价值,给出未来模型发展预测。

量子位
推荐文章7

对话 Roto:让视频实时可交互、足够个性化,我们要做 AI 时代的 Netflix

Roto定位是全球首个互动开放世界视频平台。创始人David Xu曾就职独角兽企业,涉足多模态生成。团队经多次方向调整,决定大胆探索极致创新。目前产品技术不成熟,但已探索新内容形式,还将在广告实现商业闭环。

Founder Park
新闻资讯8

具身导航,感知推理到底是「上帝」,还是执行控制是「命门」?| GAIR Live 023

本文是GAIR Live 023圆桌对话实录,浙江大学彭思达与具身多模态算法专家郝孝帅探讨具身导航。涉及本质、范式、挑战、交互等方面,还对未来5 - 10年发展做了展望。

AI科技评论
开源动态8

迈向AI4S 2.0,上海AI实验室开源书生万亿科学大模型Intern-S1-Pro

2月4日上海人工智能实验室开源万亿参数科学多模态大模型Intern - S1 - Pro,为AI4S迈向2.0提供开源基座。其核心科学能力跃升,底层架构创新,科学与通用能力协同发展,还构建了‘算力 - 算法’一体化基座,推动科研范式革命。

OpenMMLab
推荐文章7

LightX2V Ulysses Attention 实现学习笔记

本文记录了LightX2V中Ulysses Attention的实现方式与张量形状推导。在多模态/视频场景,其实现可概括为一种layout变换,还提供`enable_head_parallel`和`use_fp8_comm`选项,效果受运行环境等因素影响。

GiantPandaLLM
7

杨植麟预告,Kimi K3要来了

月之暗面团队海外AMA透露Kimi K3相关信息。K3或采用KDA架构,有低成本优势;通过开源解决信任问题;将推出不同规格模型;产品打磨注重写作、视觉能力及NSFW内容探索。Kimi性价比模式或改写行业规则。

AI产品自由
7

刚刚,「吉卜力狂欢」GPT-4o功臣被挖走!华南理工女学霸曾与奥特曼同台

GPT-4o引爆全球「吉卜力风格」风潮后,其核心成员华南理工学霸Lu Liu与伯克利博士Allan Jabri跳槽Meta。此前他们在OpenAI主导多模态AI研究,与奥特曼同台展示关键功能,此次挖角凸显OpenAI人才流失危机。

新智元
产品应用7

不是「电商 AI」,而是「AI 电商」

GenAI时代,AI与电商消费结合成趋势,“值得买科技”提出“全面AI战略”,发布火眼AIUC引擎等4个作品。其海纳MCP Server可输出消费服务能力,推动AI生态建设。还落地什么值得买Gen2和张大妈Agent等应用。

特工宇宙