「训练数据污染」共找到 3955 篇相关文章
从平面几何出发:形式化验证如何驱动MLLM的推理能力跃迁
多模态大语言模型在复杂数学与几何推理中有缺陷,现有训练方式让模型难有鲁棒推理能力。上海交大等团队提出“以形式化增强非形式化推理”方案,构建完整闭环,提升模型推理及泛化能力。
Meta&UIUC大发现:无需标注,Agent复杂的工具使用和搜索能力,是可以“无中生有”的
Meta和UIUC研究发现,无需标注,Agent复杂工具使用和搜索能力可“无中生有”。论文Dr. Zero让大模型自我博弈成搜索专家,用HRPO提效,设计难度导向奖励,实验表现佳,但也存在局限。
空间智能终极挑战MMSI-Video-Bench来了,顶级大模型全军覆没
上海人工智能实验室 InternRobotics 团队推出空间智能视频基准 MMSI-Video-Bench,对主流多模态大模型进行评测。该基准题型全面、问题具挑战性,视频数据多样,能针对性测评。结果显示模型与人类差距显著,明确了能力瓶颈。
Agentic-KGR:通过多智能体强化学习实现知识图谱的协同演化
文章指出静态知识库有覆盖缺失、时效滞后、建用分离问题。介绍 Agentic - KGR 创新点,如动态 schema 扩展等。实验显示其在图谱抽取和下游 QA 任务有提升,还呈现训练动态和图谱质量可视化结果。
基于一个MXFP8量化Kernel谈一谈如何在B200上实现高性能的Memory Bound Kernel
作者向SGLang社区提交基于CUTLASS的MXFP8 Blockscaled Grouped GEMM实现,其中包含量化Kernel。文章关注此Kernel,介绍在B200上实现高性能Memory Bound Kernel的优化技术,如整体设计、向量化与合并访问、Occupancy优化、TMA利用等。
经验记忆黑科技:LightSearcher让AI工具调用减39.6%、推理快48.6%
现有的 RL 驱动的深度思考大模型系统面临准确率与效率的「跷跷板」困境,北邮百家 AI 团队提出 LightSearcher 框架,解决了这一痛点,在保持准确率的同时,显著提升了工具调用效率。
打破确定性魔咒!北航团队提出VBF++:用“不确定性建模”刷新多模态视频推荐 SOTA
北京航空航天大学和北京邮电大学联合提出VBF++框架,将多模态融合从“点估计”升级为“分布建模”。它由上下文感知先验、推荐引导的对抗优化和元学习三大组件构成,在多个数据集上刷新SOTA。
Khosla 继 OpenAI 后的最大赌注,General Intuition 凭 38 亿个游戏高光片段做世界模型
今年10月,General Intuition完成1.34亿美元种子轮融资,由Vinod Khosla领投。它从Medal分拆,有38亿游戏短视频片段,可赋予机器“直觉和物理常识”,与LLM互补,商业化将从游戏拓展到物理世界。
超实用提示词模板!AI科学家教你用协作提示词激发大模型潜力
文章由知名AI科学家Lance Eliot所写,指出主流大语言模型因训练机制变得‘短视’,缺乏深度协作能力。介绍协作提示词技术,能让AI成为主动引导者,并以测试展示效果,还说明了适用场景。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
当谷歌Gemini 3将上线消息传得沸沸扬扬时,马斯克xAI更快一步上线最新大模型Grok 4.1,响应速率提升、幻觉率下降。它有两个“形态”,免费开放且有APP版。在LMArena测试中成绩亮眼,多方面能力提升。