「论文自动审阅器」共找到 1556 篇相关文章
多模态大模型,真的「懂」世界吗?——揭秘 MLLM 的核心知识缺陷
ICML 2025高分论文揭示MLLM核心认知盲区。研究发现主流MLLM缺乏核心认知能力,且不能靠规模扩展自然习得。作者构建测评体系CoreCognition,提出干预测试方法Concept Hacking,还给出关键发现与启示。
只因一个“:”,大模型全军覆没
一篇论文发现冒号等符号、“Thought process:”等语句能欺骗LLM,让虚假回答通过。实验表明所有测试模型都会触发假阳性响应。研究人员构建新“评委”模型Master - RM,可让假阳性率接近0%。
DeepMind揭示Reasoning内在机制
近年来大型推理模型在复杂任务表现出色,但推理机制成谜。本文提出用推理图解码其‘思考轨迹’,分析环状结构、直径大小和小世界特性,发现蒸馏模型等特点,为理解AI推理及模型优化指明方向。
ICML 2025 Oral!北大和腾讯优图破解AI生成图像检测泛化难题:正交子空间分解
OpenAI推出GPT - 4o图像生成功能,AI生图安全挑战凸显,区分生成与真实图像成难题。北大与腾讯优图研究人员用正交子空间分解解决AI生图检测泛化难题,论文被ICML 2025接收。
ACL 2025 | 让小说角色 「活」起来!复旦BookWorld打造沉浸式小说世界模拟系统
复旦大学团队主导的BookWorld系统,是ACL 2025论文成果。它能从小说提取数据构建AI世界,让角色AI互动创作故事。系统有自主和干预模式,实验表现出色,未来可成互动娱乐平台。
用大模型检测工业品异常,复旦腾讯优图新算法入选CVPR 2025
AI模型用于工业异常检测获新SOTA,相关论文中稿CVPR 2025。复旦大学、腾讯优图实验室等机构研究人员设计基于扩散模型的少样本异常图像生成新模型DualAnoDiff,实验显示其性能更优。
73%人类认同率!Video-Bench实现视频质量精准打分
上海交大等团队提出视频评估框架Video - Bench,让多模态大模型‘像人一样评判视频’。它构建双维度评估框架,引入链式查询和少样本评分技术,与人类判断73%高相关,为视频生成模型优化提供标尺。
特斯拉终于着急了
特斯拉交出史上最差季报,净利润暴跌、汽车收入骤降。其处于从汽车向人工智能转型过渡期,却面临汽车业务疲态、AI业务落地难的问题,如Cybertruck和Model 2/Q未达预期,资本市场耐心受考验。
震撼全网,AlphaEvolve矩阵乘法突破被证明为真!开发者用代码证实
开发者用Claude写代码证实谷歌DeepMind的AlphaEvolve求解矩阵乘法的突破为真,它将4×4复数矩阵计算次数从49次减到48次。小哥测试代码各项指标与论文报告一致,还上传到GitHub。
苹果与Anthropic合作,开发AI编程助手
彭博消息,苹果与Anthropic合作,为Xcode打造AI编程助手,集成ClaudeSonnet大模型,可自动完成代码编写等工作。现处内部测试,若顺利将向第三方开发者发布,有望改变苹果平台应用开发方式。