「高质量论文」共找到 3109 篇相关文章
广域铭岛 x 领克汽车张家口工厂:一座工厂的智造进化论
广域铭岛‘工厂大脑’产品落地领克张家口工厂,解决了数据割裂、异常处理难等问题。通过四个核心场景,实现管理、流程和决策升级,验证了‘数据+AI’在复杂制造场景中的价值。
从“一句成片”到“长轨推演”:探究多模态智能体在长视频编辑中的应用
近年来大语言模型在长篇视觉叙事中潜力卓越,但长视频剪辑仍难控制。中科大等团队开源工作从系统工程视角研究多模态智能体在长视频编辑中的机制,重构剪辑管线,找到症结并给出解决办法。
用脑机接口上班是什么体验?一个渐冻症患者使用了两年后表示:其实很无聊
加州大学戴维斯分校团队为渐冻症患者凯西植入脑机接口,装置工作 19 个月处理 18.3 万个句子,证实其长期稳定性和临床实用价值。不过,脑机接口难以兼顾多方面要求,商业推广也面临诸多门槛。
NVIDIA团队让编程Agent接管真实机器人实验,成功率达99%
NVIDIA GEAR 实验室负责人介绍 ENPIRE 项目,首次在机器人硬件实现自动化研究。让 8 个 Codex Agent 驱动闭环,完成高精度任务,成功率 99%。项目计划开源,还提出 MRU 与 MTU 指标。
当 AI 产品卷向同质化,支付成为最后的增长杠杆
AI应用商业化进入新阶段,头部效应显现,竞争同质化严重。支付成为关键变量,其复杂性远超预想,支付失败损耗大。优化支付需系统诊断,它是商业化基础设施,影响营收。全球支付格局复杂,Payinsider助力企业搭建支付架构。
北大校友Lilian Weng出镜,爆出120亿估值首个交互模型!
北大校友Lilian Weng出镜介绍Thinking Machines的交互模型,此模型200毫秒神同步,能感知协作。该公司此前获20亿美元种子轮融资,估值达120亿美元。模型打破传统交互局限,或改变人机互动方式。
只看图片就能学会压缩Token!浙大&阿里新框架多轮VQA压缩率90%,精度不掉|CVPR 2026
多轮视觉问答成LVLM推理效率“照妖镜”,现有压缩方法在多轮场景翻车。浙大宋明黎教授团队与阿里联合提出MetaCompress框架,可根据图像生成最优压缩映射,实验验证其效果优,能平衡压缩率与精度。
4400 人收藏的开源排版项目!Kami:让 AI 生成的文档,终于有了值得一看的排版!
开源作者tw93因不满AI生成文档排版,开发了Kami。它是给AI写的文档设计系统,有一套跨文档的约束集合,支持六种文档类型,安装简单,能让AI生成的文档排版更专业。
软件 3.0 时代来临
OpenAI 联合创始人 Karpathy 在 AI Ascent 2026 大会提出软件正经历第三次范式转移。从 Software 1.0 到 3.0,人类参与编程方式不断变化,3.0 用自然语言编程,中间层应用被模型原生能力吞噬。
开源SOTA!商汤原生多模态一个大脑完成看图、推理、作画
商汤开源日日新SenseNova U1,用NEO - unify架构让像素和文字自由协作,多项指标达开源SOTA,适配10家国产芯片。它能完成看图、推理、作画等多任务,虽有局限,但后续优化值得期待。