「人类运动学习机制」共找到 2475 篇相关文章
AI生成的图片正在反向对齐人类的审美?ICML 2026观点论文Spotlight
UBC和Weathon Software研究指出,图像美学对齐削弱艺术表达。开发者用评估模型让图像生成模型产出符合人类审美的图片,但这导致图片同质化,限制艺术多元性,作者还提出六个相关担忧,并做多项测试验证。
强化学习的进化:从PPO到MaxRL,LLM推理训练的算法演进史
本文概述2024 - 2026年推理LLM的强化学习进展,从REINFORCE和PPO讲起,介绍GRPO、RLOO等多种算法。指出critic模型非必需,标准差归一化有副作用,损失聚合很关键,信任域是优化切入点,还提出几个未解决的挑战。
Meta-Think ≠ 记套路,多智能体强化学习解锁大模型元思考泛化
上海交通大学等团队提出ReMA框架,将复杂推理解耦为元思维和推理智能体,通过迭代强化学习协作。在单轮实验中,ReMA在多基准测试表现优;多轮实验虽有提升但不稳定,需进一步探索。
最懂英伟达的CoreWeave,为啥突然花钱买了个强化学习作坊?
算力巨头CoreWeave市值达483.9亿美元,收购专攻强化学习训练AI智能体的OpenPipe。CoreWeave想打造全能平台,此前已收购W&B,此次收购标志其涉足智能体核心训练环节。OpenPipe的ART框架有独特优势。
20000 GPU·h砸出 106 个SOTA模型架构:AI 科研进入“自我加速”时代
模型架构发现领域迎来突破,ASI - ARCH超级智能体无需人类预设搜索空间,完成科研闭环。经20000 GPU·h、1773次实验,发现106个超越人类SOTA的线性注意力架构,且已开源。
用AI重新审视人类发明史:我们的技术本该比现在更先进吗?
美国研究员 Brian Potter 用 AI 分析 1800 年到 1970 年代 190 项重大发明,判断最早何时能造。结果显示多数发明没迟到太久,1900 年后发明间隔缩短,75%约束是技术性的。
Karpathy 秒删 AI 职业分析项目,背后是,一场人类的职业大迁移
Karpathy 做了 AI 职业暴露度分析项目,引发关注后秒删。Stanford NLP 指出其分析不足。多家报告显示 AI 对职业冲击大,全球科技行业裁员,国内前端岗位受影响,还带来职业大迁移。
Anthropic 发布第四份人类经济指数报告:AI 对全球工作的影响仍然不均衡
Anthropic发布第四份经济指数报告,提出“经济基元”概念,用五个基础指标衡量AI使用情况。报告发现任务越复杂,AI加速效果越明显,不同国家使用方式有差异,还提及“去技能化”等情况及对生产力的影响。
最新推荐系统论文PDF列表-及「深度学习推荐系统2.0」所有参考文献
这是「王喆的机器学习笔记」资源帖,应读者建议更新推荐系统论文repo。收录在推荐系统发展史上有重要作用及业界最新进展的论文,还列出具体目录,方便扩展阅读。
Figure机器人直播100小时打擂台,3秒一个不停分拣13万包裹!
Figure公司F.03机器人直播分拣包裹超100小时,分拣超13万个。10小时人机对决中,人类以不到200个包裹险胜。CEO称这是人类最后一次赢,具身智能飞轮或已过拐点。