「时间衰减奖励」共找到 619 篇相关文章
中科院开源PPT Agent,一键自动生成PPT智能体
中科院软件所等联合开源PPT Agent,它能分析参考幻灯片,按人类流程分两阶段生成PPT,有自我修正功能,测试显示在多维度优于现有方法,极大节省用户时间精力。
OpenAI官宣GPT-6 Astra,AGI时代要来了吗
OpenAI官宣GPT - 6 Astra,自称‘世界上最聪明、对齐最好的模型’,总裁称迎来AGI时代。它成绩亮眼,能直接完成工作,达网络安全阈值,训练让AI深度参与,但价格较贵。
99分=0分!用《孙子兵法》《隆中对》做物理 AI,吴甘沙十年拿下全球机场 91% 份额
吴甘沙在演讲中分享驭势科技创业十年心得,用《孙子兵法》《隆中对》构建竞争策略,指出自动驾驶达99分易,最后1%难,是创业公司护城河。还介绍了市场选择、技术路线、商业模式等内容。
博士学位答辩PPT分享 | 基于神经网络的偏微分方程优化求解方法研究
本文聚焦基于神经网络的偏微分方程优化求解方法,指出传统数值求解范式有局限,物理信息神经网络(PINNs)虽有潜力但面临瓶颈。作者从多方面研究,形成工程流动问题分析框架与改进方法。
Redis之父:手写代码?醒醒吧除非你图一乐
Redis之父Antirez在博文指出,编程已被AI永远改变,手工写码不再明智。他用实测案例展示Claude Code强大效率,警告程序员别喝‘反AI迷魂汤’,应重构工作流拥抱AI。
GRPO训练不再「自嗨」!快手可灵 x 中山大学推出「GRPO卫兵」,显著缓解视觉生成过优化
GRPO在视觉生成流模型后训练阶段有显著提升,但clip机制存在系统性偏差,易使模型陷入过度优化。中山大学、快手可灵等团队提出GRPO - Guard,能降低过度优化风险,在多种任务中表现良好。
Meta这两篇最新Agent Learning论文,有些意思!
分享Meta SuperLabs两篇Agent Learning论文,从‘如何低成本获得高质量经验’出发,形成技术链,为语言智能体进入‘规模化RL时代’提供路线图,还分析了Agent RL问题及两论文成果、对比。
大型语言模型稳定强化学习的新路径:几何平均策略优化GMPO
本文介绍了大型语言模型稳定强化学习新路径——几何平均策略优化GMPO。它是GRPO稳定化版本,通过优化几何平均替代算术平均,解决GRPO训练不稳定问题,在多任务实验中显著优于GRPO。
砸场GPT-5,马斯克:Grok 5 年底推出!
OpenAI举办GPT - 5发布会,现场状况百出,图表数据与柱状图不符,员工表现不佳。马斯克趁势放话,年底前推出Grok 5且会「碾压性地出色」,还引用数据挑衅,网友对此反应不一。
AI 如何“征服”美国经济:一份图文并茂的常见问题解答
美国经济已分化为火热的 AI 经济和萎靡的消费经济。AI 领域支出、股市表现、商业数据都体现其热度。顶尖科技公司因丰厚利润大力投入 AI 基建,但目前盈利不明,员工对 AI 提升生产力看法不一。