「学习方式」共找到 2106 篇相关文章
NeurIPS 2025 Best Paper | 扩散模型不为人知的“时间差”:为什么先学会创作,后学会抄袭?
深度学习中,扩散模型能生成新图像且抗过拟合。巴黎高师和博科尼大学研究团队论文指出,这源于隐含的动力学正则化,训练分两阶段,数据量增加会拉开‘泛化窗口’,还给出数学解释。
LeCun离职前的吐槽太猛了
年底将离开Meta的LeCun在播客直言,不看好大语言模型通往AGI,也吐槽Meta封闭。他将创办开源公司AMI研究世界模型,认为其与LLM本质不同,还回顾AI学习史引出JEPA架构。
打破确定性魔咒!北航团队提出VBF++:用“不确定性建模”刷新多模态视频推荐 SOTA
北京航空航天大学和北京邮电大学联合提出VBF++框架,将多模态融合从“点估计”升级为“分布建模”。它由上下文感知先验、推荐引导的对抗优化和元学习三大组件构成,在多个数据集上刷新SOTA。
刚刚开源就爆火,轻量快速,GB 大文件都秒开!
文章介绍刚开源就爆火的文本编辑器Fresh,它基于Rust语言,目标轻量、快速、功能强大,支持多平台。有上手0门槛、轻量快速等特性,还给出多平台安装方式和基本使用方法,值得开发者尝试。
100万亿Token揭示今年AI趋势!硅谷的这份报告火了
OpenRouter和a16z联合发布《State of AI:An Empirical 100 Trillion Token Study with OpenRouter》,基于100万亿Token分析模型真实使用情况,揭示2025年AI发展趋势,如开源模型崛起、推理模型成新范式等。
他们让万亿参数RL学会了「省着跑」,顺便砍掉九成算力
2025年,强化学习成大模型进化主战场,但万亿参数模型跑RL成本高。Mind Lab团队实现1T参数模型LoRA高效RL训练,GPU消耗降90%,技术开源。此外还有Memory Diffusion记忆机制等成果。
Anthropic内部揭秘20万代码交互记录背后的职业变迁
Anthropic官方发布内部实录,通过对132名工程师调查及20万条交互日志分析,揭示软件工程正从编写代码向管理代码演变。工程师AI使用率提升,工作方式、角色、信任机制等都发生了变化,也带来新挑战。
Karpathy:LLM渴望的不是生存,而是你的点赞
Andrej Karpathy指出人们对‘智能’理解肤浅,动物智能与LLM智能源于不同优化压力。动物智能源于自然选择,而LLM智能来自统计模拟、强化学习微调等,两者在多层面有差异,LLM受商业进化影响大。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
当谷歌Gemini 3将上线消息传得沸沸扬扬时,马斯克xAI更快一步上线最新大模型Grok 4.1,响应速率提升、幻觉率下降。它有两个“形态”,免费开放且有APP版。在LMArena测试中成绩亮眼,多方面能力提升。
AI为啥不懂物理世界?李飞飞、杨立昆:缺个「世界模型」,得学大脑新皮质工作
近来,杨立昆计划离开Meta创立以‘世界模型’为核心的AI公司;此前李飞飞也发文指出大语言模型弊端,强调建立‘世界模型’重要性。该模型源于对大语言模型局限的反思,能让AI理解物理世界。