「复杂任务生成」共找到 4304 篇相关文章
只用2700万参数,这个推理模型超越了DeepSeek和Claude
Sapient Intelligence研究者受大脑机制启发提出分层推理模型(HRM),该模型仅2700万参数、1000个训练样本,就在复杂推理任务上超越DeepSeek和Claude等模型,还引入近似梯度等创新设计。
微软开源多智能体自定义自动化工作流系统,加速搭建基于AI的自动化系统
微软开源多智能体自定义自动化工作流系统,可助企业用AI智能体实现复杂组织任务自动化。该方案整合多项Azure服务构建管道,有聚焦核心价值等功能,还给出部署指南与成本估算。
阿里发布信息检索Agent,可自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源
阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。
DeepSeek 峰谷 Token 的开山鼻祖,原来是阿里这个桌面 Agent
文章介绍阿里桌面 Agent 工具 QoderWork,它是最早落地「峰谷 Token」的产品,晚上 Qwen3.7 - Max 模型 2 折。该工具功能丰富,能完成复杂任务,还把配置与使用分开,降低使用门槛。
The Batch:836 | 基准测试成本攀升
独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。
告别“一眼定生死”:Agent-as-a-Judge 开启 AI 评估的下半场
过去两年,LLM-as-a-Judge成评估界“黄金标准”,但面对复杂任务力不从心。论文《A Survey on Agent-as-a-Judge》指出,应从单一的大模型裁判进化为具备行动能力的智能体裁判,还阐述了其优势、发展阶段等。
GPT-Image-2正式发布!设计师可以告别「古法设计」了
OpenAI正式发布ChatGPT Images 2.0(GPT - Image - 2),它是首个具“思考”能力的图像模型,处理复杂任务能力强,实测在商品广告、论文海报等场景表现出色,已全量上线,在大模型竞技中领先。
4000 Star,Vibe Coding终级指南:胶水编程
Vibe Coding由karpathy提出,本文分享其终极指南。介绍了胶水编程、方法论精要、工具资源、编码模型性能分级参考等内容,还给出架构与工作流程,建议选第一梯队模型处理复杂任务。
从天价咨询到免费AI,夸克能改变志愿填报这门生意吗?
高考报志愿难题一直存在,天价咨询服务并非人人能享。夸克推出国内首个高考志愿大模型,免费生成志愿报告。它能理解复杂规则、把握考生需求,经多阶段训练优化,还搭载高考知识库,产品体验简便。
汤森路透发布AI Agent,专用于税务、审计等财务领域
全球著名商业服务平台汤森路透发布面向财务专业人士的AI Agent——CoCounsel,能自动执行复杂业务流程任务,支持人机协作。其开发耗时超1年,早期客户满意度高。后续还将推新应用并扩展功能。