「工作流改进」共找到 768 篇相关文章
见微知著:LLM 奖励建模的「Analytic Rubric」范式全面综述
该文是对LLM奖励建模的「Analytic Rubric」范式的全面综述。介绍了Rubric概念来源,指出传统奖励模型存在对齐风险,而Rubric RM在多方面取得平衡,还阐述其工作流、各维度研究情况及面临的挑战。
刚刚,Claude Code大升级!卡帕西:LLM第三次变革
Anthropic发布企业协作工具Claude Tag,定位为Claude Code进化版,更擅团队协作。约65%产品代码由其参与完成,卡帕西称是LLM用户界面第三次变革。它能深入企业工作流,已在Slack测试。
性能飙升42%!人大&字节开源10万级 SWE数据集 Scale-SWE
近期,人大和字节开源10万级软件工程数据集Scale - SWE,用首创工作流从GitHub构建真实数据。基于此微调的Qwen3 - 30A3B - Instruct模型测试表现佳,其数据相比合成数据优势明显。
交大&华为联手:AI智能体进化的五种关键能力
随着大型语言模型兴起,基于LLM的聊天机器人能完成多样语言任务。上海交通大学和华为团队提出分析框架,探讨LLM聊天机器人向AI智能体进化的五个关键维度、改进方法及未来发展方向。
TypeScript 6 Beta 版发布:开发者受邀升级以迎接 Go 重写计划
TypeScript团队发布6 Beta版,它是过渡版本,专注消除技术债务和标准化,为7生态做准备。7将用Go重写代码解决性能问题。6在默认设置等方面改进,还弃用部分特性,建议开发者升级。
免费使用!OpenAI发布ChatGPT记忆功能,秒变私人助理
今日凌晨,OpenAI联合创始人Sam Altamn宣布为免费版ChatGPT提供轻量级记忆功能,未来还会改进。该功能可根据用户对话习惯等个性化回答,对多领域帮助大,文中还介绍了其使用方法及常见问答。
谷歌Gemini-0605发布,全球大模型第一!
昨晚谷歌发布Gemini 0605版本,官方称其回归0325版本效果。该版本在多项基准测试中领先,Elo评分提升。谷歌针对反馈改进,使Gemini 2.5 Pro回答更优,还取消日期后缀,输入输出Token价格有优势。
OpenAI 官方博客:用技能(Skills)加速开源项目维护
OpenAI用Codex改变维护OpenAI Agents SDK仓库方式,通过仓库本地技能、`AGENTS.md`文件和GitHub Actions,将工程工作变为可重复工作流,提升开发效率,还介绍了配置、技能架构及使用注意事项。
SGLang-Diffusion: 两个月进展
自2025年11月初发布,SGLang - Diffusion获广泛关注。过去两月持续优化,速度提升1.5倍。介绍新模型支持、LoRA支持等进展,还展示性能测试结果,阐述关键改进及未来规划。
GPT-5-Codex背后AI Agentic编程技术最新全面综述!
近期OpenAI发布GPT - 5 - Codex,其背后AI Agentic Programming重塑软件开发流水线。介绍了AI Agentic编程定义、典型工作流、技术底座、主流Agent对比分类,还展望未来5大机会。