「任务设计」共找到 3082 篇相关文章
一文搞懂 Agents 评测丨Anthropic 最新万字长文
传统模型评测方法难评估 Agent 系统,Anthropic 摸索出有效评测设计方法。文章介绍评测结构、意义、方法,涵盖编程、对话等 Agent 评测,还给出打造评测路线图及与其他方法结合的建议。
芯片初创公司的斩杀线
IC设计语境里,初创公司存在“斩杀线”,可分为生死线和温饱线。若公司在这些阶段出问题,创始人命运或受影响,对赌协议会形成个人“三条生死线”,创业团队需设防火墙。
告别碎片化日志:一套方案采集所有主流 AI 编程工具
在AI编程工具普及的当下,有效采集和分析AI代码生成数据成重要课题。该文介绍一套基于MCP架构的多AI工具代码采集方案,支持多种工具和操作系统,有轻量化、用户无感等特点,已和Aone合作。
手机上同步用 Claude Code 和 Codex,666啊~
开发者常遇AI编程任务运行时需离开电脑的困扰。开源项目`Happy`是Claude Code和Codex的移动端及Web客户端解决方案,有跨端控制、实时同步等功能,助开发者随时随地管理会话。
模力工场 027 周 AI 应用榜:从“一键生成”到“自动交付”,最会帮你干活的 AI 榜单来袭
模力工场第027周AI应用榜揭晓,上榜产品迈入新阶段,能接管关键环节。如Manus交付调研报告,秒哒将想法变应用,邀虾打通跨境电商流程。还介绍了上榜应用、趋势及上榜机制等。
清华朱军团队Nature Machine Intelligence:多模态扩散模型实现心血管信号实时全面监测
清华朱军等团队提出多模态生成框架 UniCardio,在单扩散模型中实现心血管信号去噪、插补与跨模态生成。它采用扩散模型和 Transformer 架构,结合持续学习范式,实验表现优,有望用于多领域。
个人电脑也能进行智能体RL训练?尤佳轩团队开源OpenTinker
伊利诺伊大学厄巴纳 - 香槟分校尤佳轩团队开源OpenTinker,这是全新‘强化学习即服务’系统。它通过解耦架构和友好API,让开发者在不同算力设备启动智能体训练,解决传统RL框架难题,指明下一代智能体基建方向。
谷歌重磅开源 A2UI,这将会是2026年Agentic UI的王炸级标准!
过去人和AI交互多靠文本框和语音,实际应用中存在问题。谷歌开源A2UI,是AI Agent和用户界面的中间层协议,核心是声明式JSON和客户端原生渲染,有多种能力,还给出快速入手步骤。
AAAI 2026|视频大语言模型到底可不可信?23款主流模型全面测评来了
合肥工业大学与清华大学团队推出视频大语言模型综合可信度评测基准 Trust-videoLLMs,对 23 款模型从五维度 30 项任务评测,揭示性能格局,指出模型现存问题,还开源评测框架等。
港大开源ViMax火了,实现AI自编自导自演
香港大学黄超教授团队开源ViMax框架,在GitHub获高星标。它借助多智能体协作实现AI自编自导自演视频,突破主流模型在长视频制作的瓶颈,采用多种策略应对技术挑战,不过在多方面仍有提升空间。