「训练数据污染」共找到 3948 篇相关文章
刚刚,DeepSeek又探索新架构了,开源OCR 2
DeepSeek更新DeepSeek - OCR 2,引入DeepEncoder V2架构,实现视觉编码范式转变。模型和技术报告齐开源,在多项测试中表现出色,降低重复率,为全模态编码提供路径,但在报纸类文档识别有不足。
拒绝计算“一视同仁”!Elastic Attention:让大模型学会“看人下菜碟”
现代大语言模型用全注意力机制计算复杂度高,现有混合注意力策略是静态的。为此提出Elastic Attention,引入轻量级Attention Router,具备动态路由等亮点,在主流模型测试中效果好。
Nature 正刊收录!清华 FIB 实验室揭示:AI 提升科学家个人影响力,却收缩科学整体探索空间
清华大学 FIB 实验室牵头研究表明,AI 在自然科学应用广泛,提升科学家个人影响力,但使科学整体探索空间收缩。研究基于大量论文和人员数据,还提出科研智能体系统 OmniScientist 缓解问题。
Anthropic:大模型开始意识到自己在想什么!
Anthropic的Jack Lindsey论文《Emergent Introspective Awareness in Large Language Models》对大模型做神经科学受控实验。发现Claude Opus 4/4.1能感知内部念头,区分内外状态,通过检查内部状态一致性判断输出意图。
大模型幻觉的源头找到了!清华团队锁定大模型宁愿说谎也要讨好人类的神经元
清华大学研究团队深度解剖大语言模型微观机制,确认幻觉关联神经元存在,揭示其与过度服从行为相关。通过干预神经元激活状态可增减模型幻觉行为,为开发可靠 AI 系统提供靶点。
普通人的AI知识库
对普通人而言,没必要用复杂AI知识库,把NotebookLM用好就够了。Google的两个更新让它更强大:一是升级Gemini 3,二是和Gemini应用打通。它是最适合普通人的AI知识库,有诸多优点。
AI体育教练来了!中国团队打造SportsGPT,完成从数值评估到专业指导的智能转身
现有智能体育系统多停于‘打分+可视化’,通用大模型处理体育生物力学分析有局限。中国团队提出SportsGPT框架,实现从‘动作评估’到‘训练处方’智能闭环,各模块优势明显,超越基线。
大模型的进化方向:Words to Worlds | 对话商汤林达华
量子位对话商汤林达华,探讨大模型发展。商汤的SenseNova - SI超越李飞飞团队模型,林达华认为单纯依赖参数规模的AI范式遇瓶颈,商汤推出NEO架构革新,还在落地应用优化,为年轻人指明新赛道。
谢赛宁REPA得到大幅改进,只需不到4行代码
Adobe Research等团队对REPA展开研究,发现驱动目标表征生成性能的是空间结构而非全局性能。基于此构建iREPA,代码不到4行,能提升REPA收敛速度,在多方面表现出色。
Google 开源 InkSight,把手写笔记直接变成可编辑数字笔记!
Google 开源 InkSight,能将手写照片转为数字墨迹,与传统 OCR 不同,它可「还原书写方式」。具备离线转在线、多语言支持等功能,核心是「阅读 + 书写」双重训练,有两种使用模式。