「写任务」共找到 2541 篇相关文章
刚刚,OpenAI新Transformer火了!Astra架构首次曝光
OpenAI下一代Astra采用「循环深度」推理方法,思考Token减少但性能提升,不过其思考过程难监控。此前业界已对「循环Transformer」有研究,该架构适合数学编程任务,Astra实力获验证,GPT - 6或即将发布。
基于DINOv2和SAM2改进的U-Net模型
DSU-Net是基于DINOv2和SAM2改进的U-Net模型,通过多尺度跨模型特征协作和轻量级适配器模块,解决现有图像分割模型在特定下游任务表现不足问题,提升分割精度,降低训练成本。
Claude Opus 4.1火速发布!坐稳编程之王,官方:马上还有大更新
Claude Opus 4.1正式发布,编程性能超Claude Opus 4及竞品,拿下SOTA。在Agent任务和推理方面升级,定价不变。官方将在几周内大规模改进。Anthropic借客户背书,暗秀关系,文风受开发者喜爱。
AI 编程越来越厉害了,我要怎么提升自己的系统架构能力?
文章指出 AI 写代码能力提升,对程序员系统架构能力要求更高且难被替代。介绍系统设计概念,分析做系统设计的难点,给出新人提升系统设计能力的方法,还说明 AI 可辅助提升该能力。
新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o
过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。
榨干Codex!OpenAI工程师亲授Codex真正用法
OpenAI客户支持工程师Jason称,Codex不只是编程助手,而是完整电脑工作系统。通过持久对话流留存记忆、语音输入精准表达、自动化接管任务等,能让机器高效完成各类工作,人还可随时干预。
小模型代替顶级闭源:微软用4B小助理,砍掉30% Token消耗
微软研究团队提出实用方案,用4B参数的微型模型Terminus - 4B替换昂贵顶配大模型接管终端执行任务,采用SFT和RL策略打造子智能体,经测试效果良好,节省Token消耗。
年轻人的第一个爱马仕
AI圈的Hermes是Nous Research开发的开源Agent框架,GitHub星数超35000。作者写76页《Hermes Agent从入门到精通》,介绍其设计思路、使用方法等,中英文版可在GitHub免费下载。
告别“一眼定生死”:Agent-as-a-Judge 开启 AI 评估的下半场
过去两年,LLM-as-a-Judge成评估界“黄金标准”,但面对复杂任务力不从心。论文《A Survey on Agent-as-a-Judge》指出,应从单一的大模型裁判进化为具备行动能力的智能体裁判,还阐述了其优势、发展阶段等。
这一年,DeepSeek消耗14万亿Token,编程仅占1/10,超一半用于角色扮演?
a16z和OpenRouter基于100万亿token研究揭示LLM使用情况:开源模型占三成市场,编程任务成刚需,角色扮演是金矿。还提到‘玻璃鞋效应’影响用户留存,市场分层为‘高端闭源+性价比开源’双轨制。