「ICLR论文」共找到 1075 篇相关文章
机器人终于能用明白洗碗机了|UC伯克利新研究
UC Berkeley团队发表研究论文,通过‘模块化教学+智能选动作’方案破解人形机器人全身协同难题。该方案结合星动纪元STAR1硬件优势,经实验验证效果远超传统方案,为机器人产业化带来落地价值。
视觉模型既懂语义,又能还原细节,南洋理工&商汤提出棱镜假说
南洋理工与商汤团队提出 Prism Hypothesis(棱镜假说)与 Unified Autoencoding(UAE)。论文指出视觉基础模型中语义理解和像素保真很难兼得,用频率谱统一视角解决冲突,UAE 实验效果良好。
谷歌首次曝光太空AI计划:要建“AI版星链”,AGI的终极基础设施?
谷歌曝光Project Suncatcher计划,要构建太空AI计算集群。此设想是部署卫星星座建“太空数据中心”。虽面临诸多挑战,但从物理学和经济可行性看并非遥不可及,谷歌已发表相关预印本论文。
内存直降50%,token需求少56%!用视觉方式处理长文本
在NeurIPS 2025论文中,南京理工大学等校研究团队提出VIST框架,为大语言模型长文本高效推理提供视觉解决方案。它模仿人类阅读机制,让模型具备选择性阅读能力,减少Token需求和内存使用。
如何在24GB显存里,塞下一个万亿参数的巨兽?KTransformers入选顶会SOSP
清华大学与趋境科技联合研发的KTransformers系统,可让消费级显卡跑万亿级参数模型,其论文入选SOSP 2025。该系统解决MoE模型本地部署难题,技术创新多,还与SGLang合作,提升硬件利用率。
Karpathy 评 DeepSeek-OCR:分词器必须消失!马斯克:光子才是 AI 的终极语言
Andrej Karpathy 发长文讨论 DeepSeek - OCR 论文,提出图像输入比文本更高效,还表达对分词器的厌恶,认为其必须消失。马斯克称 AI 主要交互将是视觉。开发者分享实践经验,也有人提出质疑。
视觉领域的GPT-3时刻!DeepMind首次证明Veo3模型实现对物理世界建模和推理
谷歌DeepMind研究团队论文显示,视频模型Veo 3学会‘无师自通’,能处理多种没学过的视觉任务。研究人员将其能力分四级,还做了定量评估。研究认为机器视觉或正处范式转变边缘。
CMU&斯坦福提出Reasoning新范式!自己找“窍门”,教会LLM抽象Reasoning
大型语言模型解决复杂推理问题时效率低,论文提出创新方法,让模型利用“推理抽象”,通过RLAD两玩家强化学习框架训练,在多基准测试提升性能,还分析了其作用、局限与未来方向。
AI优质信息源整理:高质量网站、博主与Twitter资源推荐
文章整理了AI优质信息源,介绍Twitter在AI浪潮中的重要性及筛选优质信息流方法,还列举知乎、B站等平台,以及资讯平台、网站、播客、博客等资源,给出挑选标准和了解领域的技巧。
让大模型合成检查器:UIUC团队挖出Linux内核90余个长期潜伏漏洞
伊利诺伊大学香槟分校张令明老师团队的论文提出KNighter,它让大模型生成静态分析检查器,在Linux内核挖出92个长期潜伏漏洞,将LLM归纳能力沉淀为规则,带来可落地等好处。