Skill设计模式」共找到 2381 篇相关文章

新闻资讯7

Claude最强领域被GPT反超!GPT 5.5最难编程基准破0

编程领域曾由Claude引领,如今GPT 5.5在大模型解决率为0%的最难编程基准上实现突破。程序重建基准测试(ProgramBench)考验严苛,过往模型解决率为0,GPT 5.5高和超高推理模式成功破局,展现了不同解题风格。

AIGC开放社区
开源动态7

Qwen3小升级即SOTA,开源大模型王座快变中国内部赛了

开源大模型进入中国时间,Kimi K2风头正盛时,Qwen3迎来升级,235B总参数量仅为Kimi K2四分之一,基准测试性能却超它。Qwen官方不再用混合思维模式,新模型仅支持非思考模式,此次是小更新,大招在后头。

量子位
产品应用7

作业帮Flink On K8s落地实践

本文分享作业帮2025年Flink on k8s的探索与实践,包括选型思考、平台架构演进等关键内容。介绍了历史on Yarn模式的问题,阐述选型Flink K8s Operator模式的原因,还提及任务状态观测、环境资源成本等,分析核心问题并给出解决方案。

InfoQ
产品应用7

出了两道真题考 GLM-5.2,Opus 4.8 和GPT 5.5 陪跑

作者对GLM - 5.2、Opus 4.8和GPT 5.5进行两项测试。一是审计Skill体系,GLM - 5.2覆盖skill数多、找出冲突多,还挖出bug;二是做世界杯夺冠推演器网站,Opus表现出色,GLM - 5.2省token,Codex有巧思但结构有缺陷。

AI产品黄叔
产品应用7

我的Agent系统设计思路

作者介绍内容生产系统newtype OS,以写Newsletter为例展示其运作,包括主Agent Chief的工作流程,如获取文档、制定大纲、分配任务等,还阐述使用AI工具的思路,后续将添加自我总结模块。

newtype AI
产品应用7

Hermes推出Curator功能:自动清理Skill 仓库

Hermes推出Curator功能解决技能仓库膨胀问题。它每7天(可配置)自动运行,检查技能使用频率等数据,将30天未用技能标记为‘stale’,90天未用的移至归档目录,还能建议技能合并方案。

AI工程化
推荐文章7

编程 Agent 如何重塑工程、产品和设计

软件公司 EPD 目标是做出好软件,产出为代码。编程 Agent 让写代码变简单,使 EPD 角色定位改变,如 PRD 传统流程终结、瓶颈转向评审、通才更有价值等,各角色需适应新变化。

宝玉AI
算法论文8

告别死记硬背!SkillRL自动提炼Skills持续进化

大型语言模型智能体常孤立运行,难从经验学习。SKILLRL受人类技能启发,提出有效经验迁移需抽象。它通过经验驱动的技能蒸馏、分层技能库和递归技能进化机制,在多实验中表现出色。

PaperAgent
算法论文8

一篇19种自进化Agent Skill框架最新综述

这篇来自Rutgers大学和UNC Charlotte的survey,首次系统梳理Agent技能的进化与评估全貌,覆盖19种技能进化方法和10个评估基准。指出当前评估体系有诸多不足,如无法追踪技能多轮反馈后是否变好等。

PaperAgent
推荐文章7

AI时代,最老的设计哲学反而最有效

50年前的Unix哲学‘万物皆文件’和‘文件夹即应用’正以意想不到的方式回归。过去因‘人类可理解性’被推崇,如今因AI能操作而重获重要性,文件夹成‘智能空间’,AI成其操作系统。

newtype AI