「ImageNet数据集」共找到 2626 篇相关文章
登上NeurIPS,Genesis开创无需OCC引导的多模态生成新范式,在视频与激光雷达指标上达到SOTA水平
华中科技大学与小米汽车提出多模态图像 - 点云联合生成框架Genesis,采用两阶段架构和DataCrafter模块。在nuScenes数据集实验显示,其在视频与激光雷达指标达SOTA水平,还提升了下游感知任务效果。
基于离散扩散模型的高效音频修复方法
数字音频时代音频易损坏丢失,传统修复法处理长间隙不佳。本古里安大学研究人员提出基于离散扩散模型的音频修复法,经MusicNet数据集实验验证,该方法在各间隙长度上表现优异。
关于 AI Agent,「实在」、「好用」可能比「颠覆」更重要
8月18日百度AI Day上,百度文库、网盘联合发布全端通用Agent「GenFlow2.0」。它无需邀请码,多专家协助,能利用文库和网盘数据,实测在多场景表现超预期,稳定高效,“好用”才是关键。
人大高瓴-华为诺亚:大语言模型智能体记忆机制的系列研究
中国人民大学高瓴人工智能学院与华为诺亚方舟实验室聚焦大语言模型智能体记忆能力,形成含综述论文、数据集和工具包的研究体系。探讨记忆概念、重要性、实现与评测方法,还构建评测榜单、实现工具包。
3D-R1:让AI理解3D世界的下一步
文章介绍新研究3D - R1,它是更通用、具推理能力的三维视觉语言模型,解决了当前3D VLM空间理解不足与推理能力薄弱问题,在多任务测试领先,有广阔应用前景。
北大发布学术搜索评测ScholarSearch:难倒一众DeepResearch的“开卷考试”
北京大学DS - Lab发布ScholarSearch,这是评估大语言模型学术检索能力的数据集,含223道高难度题目。评估显示现有模型表现欠佳,纯推理模型准确率低,有搜索功能的模型虽有提升但仍不足。
60%情况下,主流大模型没理解风险只是装懂!别被模型的“安全答案”骗了
研究发现超60%案例中主流推理模型生成合规答案却未真正理解风险,存在系统性漏洞。淘天集团团队引入“表面安全对齐”术语,推出Benchmark研究该现象,还介绍了数据集生成流程及评测指标。
因果发现大模型迎来「理论破局」: DAG-FM 破解异质机制下的因果图识别与涌现难题 | GAIR Paper 116
浙大、清华与稳准智能联合发布因果发现大模型DAG - FM,解决了现有模型缺乏理论基础、易产生非法环路和显存爆炸问题。它在理论上证明因果图可识别,架构上避免环路,处理数据能力强,还将推进特定领域预训练。
88天登录193次!顶级证据+循证医学,让500万中国医生拥有「神助攻」
国内医生面临高负荷工作与医学知识快速更新的挑战,通用大模型在医学场景中存在高幻觉率问题。阿里健康推出医学AI产品「氢离子」,具备低幻觉、高循证特点,有四层循证架构,还与多方合作构建数据壁垒。
一次性应用出现,个人独角兽崛起:顶级布道师Jeff Barr论AI如何重塑开发者生态|InfoQ独家采访Jeff Barr
InfoQ 独家采访亚马逊云科技核心奠基人 Jeff Barr,探讨 AI 对开发者生态的变革。他认为 AI 是能力放大器,将催生一次性应用和个人独角兽,开发者角色转变,沟通和数据更重要,还介绍了应对建议及 Kiro 挑战活动。