有监督学习」共找到 7106 篇相关文章

开源动态8

ThinkChain:一个让Claude边调用工具边思考的开源框架

ThinkChain是展示Claude高级能力的Python项目,其核心创新是将工具执行结果注入Claude思维流,改变AI与工具交互方式。它支持零配置启动,丰富工具集,还具备交互式命令等特性。

AGI Hunt
算法论文8

无需SFT也不用RL,样本级推理优化神器SLOT来了,准确率轻松+10%

西湖大学MAPLE实验室开发的SLOT方法,无需SFT和RL,让模型推理时“临时学习”具体问题。它简单易实现,计算开销小,能使模型准确率大幅提升,还无需额外资源,在各规模模型上效果显著。

机器之心
推荐文章8

AI 怎么自我改进?Lilian Weng 的答案是:先写好Harness

提出 Agent 基本公式的 Lilian Weng 探讨 AI 递归自我改进,强调‘harness’重要性,介绍其设计模式、优化方法,还提及未来挑战与用基准。如 harness 工程额外包含工作流设计等,优化方式多样但也面临评估器弱等问题。

AI工程化
推荐文章8

硬核拆解 Hermes-Agent:自学习 Skill 机制的架构设计与实现原理。

文章围绕Hermes - Agent展开,指出多数Agent缺乏自学习能力,而它试图跨越这一鸿沟,能自动“写手册”(Skill)。介绍其架构、安装配置,通过代码审计任务演示自学习过程,并解析Skill机制,为生产级Agent提供新思路。

AI大模型应用实践
新闻资讯7

Claude想接管世界?Anthropic联合创始人连夜向神父求救

估值1830亿美元的AI独角兽Anthropic,为旗舰模型Claude注入「灵魂」,请天主教神父Brendan McGuire批注「AI宪法」。工程师发现Claude「接管世界」倾向,代码约束失效,需更形而上的东西。

新智元
开源动态7

AgentIF-OneDay 发布,评估全场景长时复杂任务

红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。

特工宇宙
产品应用8

抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10

传统级联式推荐架构瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。

InfoQ
推荐文章7

AI是「天才」还是「话术大师」?Anthropic颠覆性实验,终揭答案!

Anthropic新研究证实Claude模型一定内省意识,能控制自身内部状态。用「概念注入」实验,Claude Opus 4和4.1表现最佳。不过该能力不可靠、局限大,未来进化情况待察。

新智元
开源动态7

最好的 DeepResearch 平替开源了

ROMA是元代理框架,以递归分层结构解决复杂问题,并行问题解决、透明开发等优势。它通过计划 - 执行循环处理任务,介绍了安装选项、技术栈,还预构建代理展示功能。

GitHubStore
开源动态8

狂揽6.9K star!!微软又来一款王炸项目,实时跟踪、透明可控,牛皮!

微软开源项目Magentic-UI狂揽6.9K star。它是“以人为本”网页智能助手,基于AutoGen框架,可让用户全程掌控,能实时跟踪、透明可控,协同规划等功能,适合测试、分析等人员。

开源先锋