「工具集成强化学习」共找到 2846 篇相关文章
逆强化学习全新视角的大模型对齐技术
文章从逆强化学习(IRL)视角回顾LLM对齐进展。先介绍强化学习基础及挑战,将LLM生成过程化为MDP,探讨无奖励函数的MDP,说明需神经奖励模型,还阐述通过奖励建模实现IRL及多种优化方法。
支持5000+ Server,ScaleMCP为大模型Agents动态同步MCP工具
现有工具选择框架未整合MCP服务器,存在重复、不一致和低效问题。普华永道提出ScaleMCP,配备MCP工具检索器,还提出TDWA嵌入策略,通过实验证明其提升了LLM代理性能。
一句话生图要过时了?开源图像生成Agent进化出「工具编排」
来自多机构的研究团队提出GenEvolve,将开放图像生成建模为「工具编排轨迹」。它配置三类工具,经多轮决策完成生成。通过构建数据集训练,实验显示在多基准上表现出色,已开源模型、代码等。
工作场景AI化,一个月花100美元订阅AI工具值吗?
InfoQ《极客有约》X AICon 直播栏目邀请来也科技胡一川等探讨 AI 时代「10x 个体」与「10x 组织」。指出「10x 个体」核心是主动思考、善用工具,组织应从「固态」向「液态」转型,还分享了 AI 工具使用与落地经验。
开源安全工具 Trivy 遭供应链攻击,引发行业紧急响应
开源漏洞扫描工具 Trivy 遭供应链攻击,恶意版本 v0.69.4 含外传敏感数据代码,通过正常渠道传播。攻击者利用攻破的凭证操控发布流程,影响或扩大,维护团队已采取措施,引发行业对开源工具信任边界的讨论。
强化学习之父:LLM主导只是暂时,扩展计算才是正解
新晋图灵奖得主、强化学习之父Richard Sutton在新加坡国立大学演讲时预测,大模型主导是暂时的,未来五年甚至十年内不是技术前沿。他认为AI应从依赖人类数据转向体验学习,强化学习潜力需靠扩展计算支撑。
1899个MCP服务安全研究:7.2%存在漏洞,5.5%暗藏「工具投毒」
研究人员对1899个开源MCP服务器扫描,发现7.2%项目有漏洞、5.5%遭工具投毒。MCP虽成事实标准且发展好,但代码质量堪忧,传统安全工具难检测其风险,为生态敲响警钟。
智谱开源GLM-4.5工具调用超越Claude Opus 4.1,成本仅1.4%
开源模型GLM-4.5在伯克利工具使用榜单上超越Claude Opus 4.1,运行相同任务成本仅为1.4%。它采用MoE架构,在多场景表现卓越,推理速度快,成本低,还接入多款主流编程工具。
右兔短视频去水印工具正式上线!
右兔去水印工具,一键解析全网短视频,无需广告,免费下载,支持高清原画质。
阿里:RL强化LLM推理,是技巧还是陷阱?
近年来,强化学习(RL)成为解锁大型语言模型(LLM)复杂推理能力的关键工具,但该领域也面临技术选择困境。阿里联合多所高校的论文通过大规模可复现实验,揭示主流RL技巧的机制与适用场景,还发现极简组合(Lite PPO)性能超越复杂方案。