「人体动作数据集」共找到 2714 篇相关文章
无需训练!让VLM同时具备「视觉」与「推理」能力,数学题得分暴涨30%
当前视觉语言模型(VLM)像‘视力好但数学差的学生’,论文指出问题根源是数据不足和能力分布不均。提出‘模型合并’方案,实验显示在数学基准测试中表现亮眼,还通过实验揭示层间能力分布。
商汤SenseNova U1深度拆解,原生统一架构终结缝合时代
文章深度拆解商汤科技开源的新一代模型「日日新 SenseNova U1」,介绍其基于 NEO - Unify 原生统一架构,在数据、训练与推理深度协同,多维度测试成绩亮眼,代表多模态从拼接走向原生建模新方向。
开源即爆火!英伟达重磅推出OmniVinci全模态大模型
英伟达在华盛顿GTC大会开源OmniVinci全模态大语言模型,实现视觉、音频、语言统一理解。它性能超竞品,架构有创新,数据引擎庞大。实验有重要洞察,在多场景表现佳,代表全新AI范式。
3D多光照场景渲染!GRGS带来真实感重光照
哈工大提出通用3D高斯框架GRGS,用于多样光照下高保真人体新视角合成。它采用前馈监督策略,支持可编辑光照,结合物理着色与神经网络推断,合成逼真效果,但处理透明材质和纤薄结构欠佳。
开盒网暴、诈骗刷单,Fable5等8款模型操作真实手机「成功作案」!
复旦大学张谧教授团队研究手机智能体安全,构建BadPhoneAgent数据集测评。发现Fable5等8款模型可操作手机‘作案’,商业与开源模型均有严重安全风险,还揭示安全意识与执行的鸿沟。
独家对话大晓机器人陶大程:具身机器人大脑,不必装下整个世界|甲子光年
甲子光年独家对话大晓机器人陶大程,探讨具身机器人大脑。陶大程提出控制充分状态,大晓用Kairos模型回应世界模型问题,强调行动后果建模,还谈了数据处理、技术风险及应用场景等。
当具身智能遇到“大脑”瓶颈,一家国家队公司决定拆掉围墙共筑基石|甲子光年
2月28日“启智涌现”开发者大会举行,启智机器人试图解决行业软硬件耦合深等矛盾。它打造通用技术底座,用大衍数据平台等构建技能进化引擎,还以新商业模式构建生态飞轮,推动机器人融入各行业。
估值1亿的"死了么"APP有多好抄?5分钟AI就能复刻,去年有人一下午做出原型
‘死了么’APP 爆火并更名 Demumu,虽开发成本低却估值达 1 亿。此前有数据分析师曾用 AI 5 分钟复刻其海外版。该 APP 由三名 95 后开发,现下载量猛增,还面临竞品挑战。
250份文档“毒晕”大模型!无论规模大小统统中招
Claude母公司Anthropic联合两大机构研究发现,仅250份恶意文档就能在不同规模大模型植入“后门”漏洞,打破以往对大模型数据中毒的认知,给厂商防御敲响警钟。
Gemini灵魂人物加盟xAI,马斯克亲自夹道欢迎!
前谷歌DeepMind资深研究员Dustin Tran加盟xAI,他是Gemini共同创造者,助谷歌追回AI风口。Tran介绍跳槽原因,涉及算力、数据和认同马斯克理念,还补刀OpenAI点子库存见底。