「推理多模态」共找到 2726 篇相关文章
前沿模型被曝年度重大漏洞:加密思维链可被轻松提取,GPT,Claude,Gemini 无一幸免
一篇 116 页论文揭示前沿模型思维链重大安全漏洞,Anthropic、OpenAI、Google 的 API 因架构问题,模型隐藏推理过程可通过两次 API 调用被大规模提取,还会带来多种安全威胁。
微小目标漏检只是因为小?从数据到代码:一文读懂 AI-TOD-R 与 DCFL 如何解决旋转微小目标检测
此文指出旋转微小目标检测存在数据空白、学习偏差、特征易丢失等难题,提出AI-TOD-R数据集、全检测范式基准和DCFL框架。DCFL可缓解偏差,在8个数据集达SOTA,还给出实战代码案例。
第一个用物理做计算原语的大规模生成模型Un-0来了,或将AI能耗降低1000倍?
Unconventional AI 发布首个以物理为计算原语的大规模生成模型 Un-0,由‘模拟耦合振子系统’驱动。其目标是降低 AI 能耗,在 ImageNet 64×64 上 FID 达 6.74,质量接近部分主流传统图像生成方法刚发布时水平。
国产GPU组了个开源局,把SGLang等核心开发者都摇来了!
国产GPU玩家摩尔线程举办SGLang × MUSA Meetup,邀请众多开源圈开发者。活动探讨如何让国产GPU进入大模型推理主流开源工程链路,显示国产GPU竞争迈向生态坐标之争。
图像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力
上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析图像编辑模型视觉推理能力。研究发现模型零样本表现弱,扩散式模型更适合视觉规划,CoT效果不稳定等。
鹏城实验室 X 中大hcp实验室推出 RADAR : 具身智能评测的新标杆
RADAR是鹏城实验室与中大hcp实验室为具身智能领域设计的评测基准,解决现有评测体系三大缺陷,通过创新设计揭示模型不足,为研究者提供方向,推动具身智能实用化。
超越MLA!新架构MLRA百万token,解码最高2.8倍速 | ICLR'26
大语言模型处理长文本时,自回归生成受限于显存带宽。为减少KV缓存开销,业界尝试多种方法,但MLA有缺陷。宾夕法尼亚州立大学等研究人员提出MLRA,拆分KV缓存为四个并行分支,降低显存占用,实现4路张量并行,性能更优。
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。
CVPR 2026 | 还在为AI「鬼画符」发愁?TextPecker即插即用破解文字渲染难题
在生成式AI浪潮中,视觉文本渲染仍是未攻克的核心难题。华中科技大学白翔教授团队等提出TextPecker,是基于结构感知的即插即用型强化学习优化策略,可适配主流生成器,提升视觉文本渲染性能,已被CVPR 2026接收。
GPT-5.4 发布,OpenClaw的能力要被取代?OpenAI 新模型不仅会自己用电脑,编程能力也拉满了
今天 GPT-5.4 发布,整合推理、编程及原生计算机使用能力。其原生电脑操作能力提升,与 OpenClaw 竞争。还带来工具搜索降成本、减少幻觉,编程能力增强但价格也升级。