任务设计」共找到 3084 篇相关文章

开源动态8

清华开源|做一门课要3天?用 OpenMAIC,30分钟生成完整互动课堂|GitHub 15.6k

OpenMAIC 是清华开源的 AI 互动课堂平台,能将主题或学习材料快速转化为完整互动学习体验。它把课堂拆成多种交互组件,架构设计出色,支持多 LLM 服务商,还能在聊天应用生成课堂。

小华同学ai
算法论文8

CVPR 2026 | 20步也能稳住画质,这个扩散加速方法不一样

扩散模型推理效率是落地应用的核心制约因素,阿里安全 AGI 实验室 - 御风大模型团队联合浙江大学提出全新扩散加速方法 TC - Padé,在低步数设置下能兼顾生成质量与推理效率,已被 CVPR 2026 录用。

机器之心
推荐文章7

Agent 看板门禁:构建 Agent Team 的 Harness 工程防御体系

文章以 Routa 看板项目卡为例,阐述 Agent Team 的 Harness 工程防御体系。指出任务完成不等于交付结束,强调 Gate First 理念,即先确认可验证状态再推进协作,还提及运行时边界等重要概念。

phodal
产品应用8

单张显卡跑出15倍推理速度,aiX-apply-4B小模型加速企业AI研发落地

3月25日,硅心科技发布专为代码变更应用场景设计的轻量级模型aiX - apply - 4B。该模型在准确率、推理速度等方面表现出色,超越部分千亿级大模型,还推出“大模型+小模型”协同架构释放企业算力价值。

量子位
产品应用7

OpenClaw 火了半年,Agent 执行层依然是工程空白

当前主流 Agent 工具链执行层基本空白,Violoop 是少数在执行层做系统化设计的项目。它是桌边触屏硬件,获取三类运行时数据,具备感知 - 判断 - 执行运行时,有多种核心能力,适合特定场景团队评估。

AI工程化
新闻资讯7

机器人浓度最高的一届春晚后,具身智能离走进千家万户还有多远?

InfoQ《极客有约》X QCon 直播栏目邀请专家探讨具身智能落地卡点。专家认为其虽面临模型泛化、数据采集等难题,但发展乐观。工业场景对通用性需求不大,Agent 架构或成关键,数据和物理交互等方面也有挑战。

AI前线
开源动态8

如何定义“人味儿”?——HeartBench评测体系建设实践

在大模型竞争格局生变,情感智能评测缺失的背景下,作者团队发布聚焦AI拟人化的中文评测体系HeartBench,介绍其设计、评估方式、迭代过程等,还沉淀了评测体系构建方法论及专家标注管理思考。

阿里云开发者
产品应用8

企业级AI Coding的落地方法,都在这本实战手册里了|甲子光年

春节后字节上线TRAE企业版SOLO模式,发布《2026企业级AI编程实践手册》。TRAE企业版SOLO模式有自主规划、工具集成、多任务并行等能力。手册沉淀字节经验,提供方法论和场景实践,助企业迈入AI原生软件工程时代。

甲子光年
算法论文8

CL-Bench的故事没有结束,生成式CL-Bench:GENIUS来了

北大团队发布GENIUS,用于评估模型生成式流体智力。它构建含510个样本、20个子任务的评测集,测试模型多方面能力。实验显示当前模型流体智力有短板,还提出免训练注意力校准机制提升性能。

机器之心
算法论文8

AI编程真面目:完整项目通过率仅27% | 上交大新基准

多校联合团队发布ProjDevBench,评估AI编程智能体端到端项目开发能力。结果显示,六种主流智能体总体提交AC率仅27.38%,从零构建任务中性能大幅下滑,还揭示了智能体多方面短板。

量子位