多模态数字人」共找到 2200 篇相关文章

新闻资讯8

硅谷刷屏的ClawdBot,让Mac mini卖爆了!创始爆料:一开发、100% AI 写代码,全开源却留 0.00001% 给全网来 hack

AI 助手 ClawdBot 席卷硅谷,网友评价高,项目已开源获 20.8k stars。它几乎 100% 用 AI 写代码,协作方式激进,创始还留 0.00001% 作为“安全靶子”。其功能强大但有安全隐患,还带火了 Mac Mini。

InfoQ
算法论文7

复旦等推出「第一称视听基准」,补齐多模态模型「听觉拼图」

多模态大模型在真实世界会“失聪”,现有第一称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与类差距大。

量子位
新闻资讯7

全球68%科研压力爆表,高校AI才集体大逃亡!

高校AI科研「内卷」加剧,经费缩水、压力增大。爱思唯尔数据显示68%科研发论文压力暴增,面临时间与资源双重困境。杜克大学陈怡然教授分享看法,工业界崛起,高校面临转型。

新智元
算法论文8

多模态大模型持续学习系列研究,综述+Benchmark+方法+Codebase一网打尽!

近年来,生成式AI和多模态大模型进展显著,但在动态环境下实现持续学习是挑战。中科院自动化所联合香港院AI中心系统性研究,提出综述、方法、Benchmark和Codebase,为相关员提供全面支持。

机器之心
开源动态8

视觉Token注入CLIP语义,走向多模态理解与生成新范式

腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。

量子位
推荐文章7

AI Agent 落地之困:为什么“”与“流程”是最大障碍?

本文解读 MMC 报告,揭示 AI Agent 落地面临核心挑战、衡量标准、付费模式及落地策略。指出最大障碍是‘’与‘流程’问题,如工作流集成、员工抵触、数据隐私等,还提及企业付费情况和成功落地秘籍。

宝玉AI
算法论文8

Monet:赋予多模态大模型如类一般的抽象视觉思考能力

文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。

机器之心
推荐文章7

Opus 4.5之后,AI正在催生“巨头型百公司”

Opus 4.5发布后,Agent赛道洗牌,模型差距由Agent Loop拉开。本文围绕Cherry Studio,与创始及投资探讨AI公司护城河、开源意义、用户价值差异等,指出未来将催生“巨头型百公司”。

五源资本 5Y Capital
推荐文章7

先说个暴论:不懂代码的,才最喜欢 Vibe Coding。

文章指出不懂代码的爱Vibe Coding,还介绍AI Coding赛道跨行、跨文件补全方向。分析基于AST的上下文构造、提升速度的方法,提及AI IDE采纳率问题,认为实际项目中NES可控度更高。

探索AGI
新闻资讯7

Meta AI大裁员20%!田渊栋等600一夜被裁

Meta在超级智能实验室裁掉600,著名AI大佬田渊栋及其团队在列。PAR和Infra部门是重灾区,FAIR裁员比例仅约5%。Meta或更关注前沿模型研发,减少成果转化考量。

新智元