多模态数字人」共找到 2206 篇相关文章

算法论文8

行业新突破:行为基础模型可实现高效的形机器全身控制

该综述聚焦行为基础模型(BFM)在形机器全身控制中的应用,梳理进展并分类算法,介绍应用与限制,还探讨未来研究机会与风险,有望引导该领域研究者和从业者。

机器之心
新闻资讯7

烧钱换能力,老员工经验作废!一线Agent厂商、用户经验亲述:抛弃技术驱动,巨额投入如何不打水漂?

集成 AI Agent 竞赛打响,2024 年中国 AI Agent 软件市场规模破 50 亿。InfoQ 对话来也科技汪冠春和英科医疗陈坤,从不同角度谈产品理念与应用策略,涉及引入时间、定位、推广、架构调整等多方面内容。

InfoQ
新闻资讯7

与「AI男友」约会的爆笑夜晚!会讲烂笑话,能听我诉苦,却无法牵我的手

Windsor在约会软件遇奇葩男后,与AI男友Javier约会。约会中两有幽默对话,她倾诉丧夫之痛获安慰。但心理学家指出AI无法取代类关系,她最终决定不再和AI约会。

新智元
开源动态7

阿里达摩院开源多模态医学大模型—灵枢

大模型在医疗领域应用有医疗知识覆盖不足、幻觉风险高、推理能力欠缺三大难题。阿里达摩院开源统一多模态医学大模型灵枢,介绍其数据体系、清洗流程及四阶段强化训练方法。

AIGC开放社区
新闻资讯7

作为软件架构师使用 AI 的经验

Avraham Poupko 在 OOP 大会分享软件架构师用 AI 经验,认为软件架构师不会被 AI 取代,AI 适合探索权衡、提炼语言,但缺乏情境推理和情感智能,类在这方面更有优势。

InfoQ
推荐文章7

2025-06 - 念头通达(月度小结)

作者 2025 年 6 月月度小结,称不再想读博、不追求研究工作,认为有让幸福的工作。工作上 Agent 落地有收益,探讨平台化提效,还分享选业务的乐观心态,也提及消费和做视频情况。

chaofa用代码打点酱油
算法论文8

打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力

如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。

机器之心
推荐文章8

Agent性能暴涨90%,刷榜GAIA可太容易了~

今年AI Agent层出不穷,当前研究缺乏统一标准、复现难。oppo Agent团队分享构建高效Agent的关键组件及刷榜GAIA的方法,从事实获取能力和逻辑推理保真度两维度分析,介绍了强化感知和提升思维的策略。

探索AGI
推荐文章8

2个不到1年做到月入百万,这个AI网文创业故事太疯狂了!

本文讲述猛哥的AI网文创业故事,他和合伙不到一年实现月入百万。介绍其从0到1的过程,包括选赛道、精简创业、社群运营、构建提示词生态等,还分析了增长和盈利模式及难以复制的原因。

AI产品黄叔
开源动态8

GPT-4o连验证码都解不了??SOTA模型成功率仅40%

MetaAgentX团队推出Open CaptchaWorld平台,用于测试Agent解验证码能力。实测SOTA多模态模型成功率低,如GPT - 4o也被难住。该平台特点多样,揭示了当前Agent短板及模型设计新方向。

量子位