「深度学习研究」共找到 3476 篇相关文章
大模型也需要睡觉!让AI打个盹,醒来更聪明
卡内基梅隆大学和马里兰大学研究发现,大模型处理长上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进长期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。
比Sora更疯狂!英伟达AI让机器人「做梦」修炼,无师自通直接上岗
英伟达新研究项目DreamGen用视频生成模型让机器人在神经网络生成的「梦境世界」自主探索学习。它能让机器人掌握新动作、泛化到新环境,合成数据暴涨333倍,还引入DreamGen Bench用于视频生成基准。
如何训练VLA?丰田研究院发布史上最大实验规模「保姆级」教程
丰田研究院和清华大学发布教程,用大量数据训练89个策略模型并验证。聚焦Co - training,研究五大模态、三种策略,对比不同架构,揭示有效和无效模态,还探讨CoT推理及多方面实验。
SkyReels-Audio让嘴型和音频完美匹配不再难
音频驱动的动态人脸生成研究较少,昆仑万维提出SkyReels - Audio框架,基于预训练视频扩散变换器构建,支持无限长度视频生成与编辑,采用混合课程学习等策略,保障视频视觉保真度和时间一致性。
17岁高中生用AI解决数学界难题,陶哲轩、Jeff Dean点赞
17岁高中生 Enrique Barschkis 课间休息时解决埃尔德什第347号问题,引发热议获 Jeff Dean 盛赞。他在陶哲轩等人思路基础上完成证明,用 AI 工具将证明形式化,成果获数学社区认可,标志数学研究进入新阶段。
马斯克惊叹!DeepSeek和Kimi先后出手,捅破了Transformer的「潜规则」!
文章介绍了DeepSeek和Kimi在残差连接上的突破。DeepSeek让连接权重可学习,用数学约束保证稳定性;Kimi将注意力机制用于层间连接,解决了更根本的问题,性能提升显著。
AI 模拟消费者,预测购买意图准确率达 90%
PyMC Labs和高露洁棕榄团队研究发现,让大语言模型扮演消费者,用另一AI评分可90%准确预测购买意图,还提出SSR方法。虽有优势,但也面临质疑和局限,可增强市场调研。
Meta提出数据筛选的理论:何时“少即是多”成立?
Meta针对机器学习领域‘少即是多’悖论提出理论框架,用高维统计等方法推导测试误差缩放定律,揭示数据筛选‘相变’条件,为实践提供指导,还重新定义‘数据效率’意义。
AI越训练,越会「满嘴跑火车」!普林伯克利重磅揭秘,RLHF竟是罪魁祸首?
普林斯顿和伯克利研究《Machine Bullshit》,定义并量化LLM胡扯行为,总结四大套路,提出胡扯指数。实验发现强化学习人类反馈训练后,AI胡扯倾向加重,多思考也会让其更会忽悠。
矩阵乘法新突破!XX^T原来可以更快!RL助力搜索,世界纪录又被提升了5%
深圳市大数据研究院、香港中文大学(深圳)研究团队,结合强化学习与组合优化技术,发掘新算法 RXTX,让 XX^T 运算减少 5% 运算量,成果在国际引发关注,不过产业化落地仍面临挑战。