「GPT-5.2」共找到 3597 篇相关文章
技多不压身,那龙虾的 Skill 是越多越好吗?
作者结合学术研究和自身经验探讨小龙虾装Skill问题。研究表明Skill并非越多越好,装多效果变差,还给出合适数量区间。同时分享用好Skill的经验,如按需安装、合理增减拆分等。
Evaluation is All You Need:评估设计的微小差异如何扭曲结果
论文以DeepSeek - R1 - Distill系列模型为例,指出大模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动大,削弱模型对比可信度,呼吁建立新评估标准。
如果你想自己搞个Coze?开源版带你上车!(第二期)
文章聚焦想自建Coze平台的用户,介绍几个热门且功能多、有国产化考量的开源项目,如FastGPT、pyspur、sim、aiflowy,涵盖功能、开源协议等信息,助读者打造免费替代品。
通用AI Agent系统AI Manus
AI Manus是通用AI Agent系统,支持在沙盒环境运行工具。文中给出使用示例,介绍环境要求、部署与开发指南,推荐用Docker Compose部署,还提及项目地址、交流群等信息。
OpenAI深夜开源HealthBench,60个国家合力开发5000段真实对话
今天凌晨1点30,OpenAI开源医疗大模型测试评估集HealthBench。其5000段核心测试对话由60个国家/地区的262名医生打造,采用多轮对话测试。测试显示大模型在医疗保健领域表现显著提升,还介绍了其构建及评估等情况。
快手搜索广告落地生成式检索新范式:UniGD生成-判别一体化重塑检索链路
快手科技针对工业搜索广告中生成式检索存在的目标割裂、新广告冷启动、异构广告语义差异等痛点,提出UniGD生成-判别一体化框架,经公开测试与工业验证,效果与业务收益提升显著。
我可太喜欢腾讯会议这个 AI 硬件了,麦克风能换脸
本文是池建强的实测分享,介绍腾讯会议联名影石Insta360推出的AI录音领夹麦,讲解产品功能与使用体验,展示其打通线下线上沟通、对接Agent整合进工作流的玩法。
Hermes Agent 发布更新 Herald:实时语音 + Agent 之间可以互相通信了
Hermes Agent 更新到 v0.20.0 代号 Herald,增加实时语音对话与唤醒词,可验证引用来源可信度,集成签名Webhook,支持代理到代理协议,还有性能与安全方面更新,顺应新 Agent 发展趋势。
Claude 和 Manus 还要人工搭框架?小米直接让 Agent 自我进化
6月12日小米Darwin Agent Team发布论文《HarnessX》,用“系统自进化”终结Harness人工调优时代,带来性能跃升。其让Harness成为“一等公民”,有可组合等特质,还能与模型协同进化,虽有局限但成热门方向。
告别单打独斗!ClawTeam-OpenClaw 一键 spawn 整个 AI 开发团队
ClawTeam-OpenClaw 是多代理协调框架 OpenClaw 深度适配版,让 AI 代理自动组队协作。它有一键 spawn 团队、智能任务依赖管理等功能,在科研、开发、投资分析场景优势明显,介绍了使用方法和项目地址。