「任务执行能力」共找到 4891 篇相关文章
Cherry Studio 复盘:从 Chat 到 Agent,一款「套壳」开源产品如何推倒重来?
Cherry Studio最初是为用户在不同大模型间切换的聊天客户端,随行业从Chat转向Agent,它开启2.0版本重构,定位转向「个人Agent平台」,底层架构重写,要解决产品复杂性、完善协作等问题。
深度体验DeepSeek Harness,我原谅它涨价了
本文深度体验了DeepSeek Harness,它已发布并开源代码。其一切如模型、工具等皆为可插拔积木,官方内置超百个插件。介绍了安装方法、使用特点,还对比了与Codex差异,认为它是Agent时代的安卓,有望推动自进化。
旅行 AI 告别只会做规划的平庸时代,飞猪帮帮决定让 Agent 做履约
8月10日,飞猪推出新一代旅行AI“飞猪帮帮”,能力覆盖旅行全生命周期。它将用户需求分为“帮我想、帮我订、帮我办”,利用Qwen模型后训练,结合多种校验手段,让AI从提供信息到进入履约环节。
百年黎曼猜想被Claude破了新纪录!是个未公开新模型
A社官宣未公开的Claude研究模型在黎曼猜想取得重大进展,将满足猜想的黎曼ζ函数零点比例下界从41.6%提高到67.2%。它靠60个智能体、3100万输出Token完成研究,几乎走完科研流程。
Agent工程化最佳实践,AICon深圳2026来了
8月21 - 22日,AICon全球人工智能开发与应用大会将在深圳举办。大会邀请产业一线专家,围绕Agent工程化等前沿方向,分享技术探索与工程实践,探讨AI从能力突破走向系统构建的新路径。
PDL 在 SGLang Kimi K3 中的应用
文章介绍 PDL 在 SGLang Kimi K3 中的应用,K3 内核优化接入 PDL 以缩短相邻内核间隙。分析 PDL 原理、在 bs=1 decode 中解决的问题,阐述计算链和通信链上的应用,还提及性能数据和实现问题。
Claude杀入全美教室:一周干49小时的老师,终于等来免费AI助教
7月14日,Anthropic推出Claude for Teachers,向全美K - 12教师免费开放高级能力与教学技能库,接入50州课标。它能完成备课对齐、差异化分层、数据分析等工作,不碰学生端,定位是帮老师减负。
国产开源新突破!5万小时真机数据,撕开行业最大痛点
蚂蚁灵波开源具身操作基座模型LingBot-VLA 2.0,用同一套模型「驯服」20种机器人构型。它覆盖5万小时真机数据,在通用泛化能力上全面升级,还带来三大底层技术革命,可降低重复适配成本。
翁荔最新博客:我们可能高估了模型,却严重低估了那层“脚手架”
前OpenAI安全研究副总裁翁荔在新博客聚焦AI领域Harness Engineering。她认为Harness是决定模型在现实任务中走多稳、多远的‘脚手架’,并梳理其演进路线,也指出研究面临评估、安全等瓶颈。
ICML 2026|如何对Multi-Agent系统进行过程评估?重新认识多智能体系统中的Orchestrator
来自南京大学NLP实验室的ICML 2026论文指出,当前主流多智能体架构中,系统失败常源于负责全局调度的Orchestrator失去对任务的掌控。论文提出相关框架和方法对其进行分析与评估。