「RL token」共找到 901 篇相关文章
首次解释LLM如何推理反思!西北大学谷歌新框架:引入贝叶斯自适应强化学习,数学推理全面提升
西北大学与Google、谷歌DeepMind团队质疑传统强化学习与反思的关系,提出贝叶斯自适应强化学习方法,首次解释为何、如何及何时反思探索新策略,还给出决策数学形式,实验显示其性能更优。
4.5k星星爆火!用图片压缩Fable 5上下文,成本大幅降低,终于用得起这个模型了
Fable 5在AI圈爆火,但使用成本比其他型号贵至少5倍。pxpipe项目把适合压缩的大段文本渲染成PNG图片,交给多模态模型读取,能大幅降低成本,还能增加上下文长度。
开源不到一天1.9k星星!NVIDIA新突破,机器人ChatGPT时刻!
NVIDIA开源ProtoMotions3框架,用经典自回归预测和物理仿真,让高级行为涌现。它能助力机器人多方面学习,有望降低人形机器人开发门槛,虽处研究阶段,但提出新思路。
拆解AI短剧流水线:4道技术关卡,和一个反直觉的赚钱真相
文章拆解AI短剧流水线,介绍其要解决的核心问题,用框架分析四道收敛闸门,提及主流工具组合,还算了成本账,指出产能涨但公司巨亏,赚钱关键从制作转向投流。
“40% 的智能体项目,将走向终止”!紫光股份董事长、新华三集团总裁兼 CEO 于英涛最新演讲全文
5月8日,新华三NAVIGATE 2026峰会召开,于英涛演讲指出,当下AI产业亢奋与焦虑并存。他提出行业三大命题,并介绍新华三全栈产品UniPoD S80000。还提及产业与信仰筑基,分享AI时代的真相与信念。
Karpathy 最新访谈:Vibe Coding 只是开始,真正重要的是 Agentic Engineering
Andrej Karpathy在访谈中分享编程范式剧变感受,谈到Software 3.0实质,指出AI能力不均,介绍Vibe Coding和Agentic Engineering区别,还提及创业机会、人类技能价值等内容。
黄仁勋迟到了15分钟,然后甩出一个数字:1万亿美元。
GTC 2026上,黄仁勋获“Token之王”称号。他预计英伟达到2027年营收至少1万亿美元,还展示商业定价模型,推出Vera Rubin系统,整合Groq芯片,开源OpenClaw,预告Feynman架构,开发太空数据中心。
沉浸式翻译杀疯了!双重开源:左手像素级还原PDF排版,右手本地AI隐私保护!
沉浸式翻译是跨平台在线翻译工具,有网页、文档等翻译功能,获千万用户与Chrome年度殊荣。近期开源BabelDoc和OneAIFW,前者还原PDF排版,后者保护本地隐私,解决阅读和安全问题。
8块钱跑通一次强化学习全流程,潞晨云重塑微调赛道:1名算法工程师=1支Infra团队
大模型下半场,后训练特别是强化学习成核心战场。潞晨云微调SDK上线,它是国内首个全面开放、且兼容Tinker范式的Serverless微调平台,为强化学习提供低成本解法,在易用性和成本上有优势。
与DeepSeek-OCR不谋而合,NeurIPS论文提出让LLM像人一样读长文本
NeurIPS 2025 论文提出 VIST 框架,为大语言模型长文本推理提供视觉方案,与 DeepSeek - OCR 理念不谋而合。它模仿人类阅读,有快 - 慢路径协作,在多任务表现优,还让模型‘用眼看文字’,优势明显。