「学术评价体系」共找到 859 篇相关文章
GPT-5编程专用版发布!独立连续编程7小时,简单任务提速10倍,VS Code就能用
OpenAI推出GPT-5-Codex特化版模型,支持独立连续编程7小时,有IDE插件版。新模型有“真·动态思考”能力,简单任务提速10倍,复杂任务推理更久。还重构了Codex产品体系,升级IDE扩展等。
一位工程师对“好代码”的 7 年思考
本文围绕“什么是好代码”展开,作者结合自身职业发展,从初入职场的“黑盒认知”到深入思考多维度评价标准。还介绍代码评审标准,从稳定、体验、效率、成本衡量。最后给出写好代码的方法和面临的挑战。
智能体新范式Chain-of-Agents,多项任务新SOTA
论文提出Chain-of-Agents (CoA) 范式,结合多智能体系统与工具集成推理优势。通过多智能体蒸馏和智能体强化学习训练智能体基础模型(AFM),实验显示其在Web和Code任务上达新SOTA,效率、泛化性佳。
构建能源领域的AI专家:一个多智能体框架的实践与思考
本文介绍阿里团队在能源领域构建多智能体框架的实践。因单智能体处理复杂任务有“注意力发散”问题,团队研发综合能源智能体平台,阐述框架搭建、各组件功能及设计考量,还分享思考与可优化点。
陶哲轩经费被断供,在线发帖自证数学有用
菲尔兹奖得主陶哲轩就职的UCLA科研经费被冻结,个人研究及应用数学研究所IPAM失去资金支持,还遭网友质疑其学术成果价值。他开新帖以“压缩感知”研究为例,力证数学研究回报,并将视野扩展到AI大模型。
多智能体在「燃烧」Token!Anthropic公开发现的一切
Anthropic发布多智能体研究系统构建解释,解决多智能体研究困惑。多智能体系统优势明显,在特定任务中表现出色,但token消耗大。其架构独特,还介绍了提示词工程、评估方法、面临的工程挑战等内容。
打破AI能力的惯性评估方式,红杉中国推出全新双轨基准测试xbench|甲子光年
红杉中国推出全新AI基准测试工具xbench,采用双轨评估体系,构建多维度测评数据集,追踪模型理论能力上限与Agent实际落地价值。还采用长青评估机制,首期发布两个核心评估集并给出综合排名,公开后邀各界完善。
全公司禁用Claude Code,CEO放狠话逼宫A社!
Shopify CEO Tobi Lütke考虑禁止公司使用Claude Code,除非其支持读取AGENTS.md和.agents/skills。Claude Code团队称正在改进,但坚持自有体系。AGENTS.md获众多工具支持,A社是相关基金会创始方,Claude Code却未原生支持。
自构建智能体:一项 LangChain4j 实验
作者将LangChain4j文档交代码助手,让其参照构建智能体,设计多智能体系统编写、测试和调试代码。实验展示了LangChain4j优势,还对比监督者和工作流两种智能体实现模式,揭示速度与自主性权衡关系。
openJiuwen社区首发Team Skills,定义Coordination Engineering新范式
文章围绕多智能体系统协作问题,指出传统任务编排方式的局限。华为JiuwenClaw团队发布Coordination Engineering新范式,通过Agent Team、Team Skills等能力,解决团队组建、技能沉淀、复用及进化等问题,并以旅行规划为例展示实战效果。