「深度学习研究」共找到 3509 篇相关文章
马斯克的Neuralink梦想成真?意识连续谱理论震惊科学界!
美国发育生物学家Michael Levin探讨意识与自我组装关系,强调意识是连续谱系。他从生物自我组装过程、意识与身份特性等多方面阐述,还呼吁用开放视角理解意识本质,并提出研究方向。
ICCV 2025 | 清华&腾讯混元X发现「视觉头」机制:仅5%注意力头负责多模态视觉理解
本文聚焦多模态大模型,提出基于 OCR 任务量化注意力头视觉偏好的方法,发现仅不到 5%“视觉头”主导视觉理解。还提出 SparseMM 策略优化 KV - Cache 资源分配,经多基准评测,性能和效率表现优。
ICCV2025 | 多视图生成新范式-利用自回归模型探索多视图生成
本文介绍自回归生成多视图图像方法 MVAR,能从先前视图提取引导信息增强一致性,拉近与基于扩散方法的图像质量差距。解决了多模态条件控制和数据有限问题,展示出强指令遵从与多视角一致性。
Hinton为给儿子赚钱加入谷歌,现在痛悔毕生AI工作,“青少年学做水管工吧”
被誉为‘AI教父’的Geoffrey Hinton在访谈中称后悔毕生AI工作。他列举网络犯罪、超级智能威胁等AI风险,建议青少年学做水管工避职业危机,呼吁AI公司研究安全并加强监管。
Cloudflare 发布公开测试版 Containers
Cloudflare宣布新的Containers服务发布公开测试版,可让开发者在其全球网络运行容器。该服务与Workers深度集成,能运行资源密集型应用等。虽有功能受限,但Reddit反馈积极,后续还有改进计划。
数学推理热潮下的冷思考!如何训练真正"全能"的推理模型?
论文评估20余个开源推理模型在多领域表现,发现多数模型数学成功难迁移。揭示微调方法(RL vs SFT)决定能力泛化,SFT像‘填鸭’,RL似‘思维健身’,为构建通用推理智能体提供新路径。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
集成20+先进算法,优于GPT-4o,自主因果分析智能体来了
加利福尼亚大学圣迭戈分校研究团队提出自主因果分析智能体 Causal - Copilot,集成超 20 种算法。它解决因果分析使用门槛高、预训练模型有局限等问题,性能优于 GPT - 4o ,已开源邀全球研究者参与。
用视频存储文本的黑科技!
memvid-rs是memvid的Rust重实现,可将文本文档编码为视频二维码实现存储和检索。它有高性能、用TRUE机器学习等特点,兼容多格式、跨平台,无需安装,适合存档文本语料库等。
田渊栋:连续思维链效率更高,可同时编码多个路径,“叠加态”式并行搜索
AI大牛田渊栋团队利用连续空间“叠加态”让大模型并行推理,提升图可达性等任务表现,为连续思维链提供理论支持。还设计注意力选择器等机制,实验显示连续思维链模型准确率更高。此外,田渊栋还是科幻小说家。