用户体验模式」共找到 2719 篇相关文章

算法论文8

ICLR-26腾讯混元:Agent是强大的,但用户是狂野的

现有LLM工具使用基准测试场景理想化,忽视真实用户行为复杂性。腾讯提出WildToolBench,基于真实用户行为构建测试集,对58个模型评估,发现模型准确率低,揭示LLM在真实场景下能力缺口,为模型优化指明方向。

PaperAgent
推荐文章8

Anthropic长文:多智能体协作模式,五种方法及其适用场景

Anthropic官方长文总结5种多智能体协作模式及适用场景,指出何时用多智能体或单智能体更好,还分析各模式工作机制、适用场景、易翻车点,给出架构选择和新手操作建议。

AI寒武纪
推荐文章8

工作流的 Skill 怎么写?从 7 个顶级 Skill 中提炼的模式与最佳实践

文章介绍工作流 Skill 写法,涵盖定义、Frontmatter 写法、5 种核心设计模式、通用写作技巧、模式选择决策树、快速上手模板及参考资源,还给出 7 个 Skill 速查表。

阿里云开发者
产品应用7

体验了两周Robot Phone,这是我第一次觉得手机活过来了。

作者体验两周荣耀Robot Phone后分享感受,它是有瑕疵但具探索感的产品,独特在云台与YOYO结合,带来新奇体验,解决自媒体人刚需,还让手机从工具迈向伙伴,使手机品类重获趣味。

数字生命卡兹克
产品应用7

深度体验DeepSeek Harness,我原谅它涨价了

本文深度体验了DeepSeek Harness,它已发布并开源代码。其一切如模型、工具等皆为可插拔积木,官方内置超百个插件。介绍了安装方法、使用特点,还对比了与Codex差异,认为它是Agent时代的安卓,有望推动自进化。

量子位
产品应用8

1段话喊来13个“程序员”,阿里Qoder新模式让我躺着当CTO

作者实测阿里Qoder「专家团模式」,该模式下Qoder组织赛博工程团队,自动解析需求、分配任务,多智能体协同推进项目,解决了代码质量和效率问题,开启多智能体协同编程时代。

量子位
推荐文章7

DeepSeek 复盘:128 天后,为什么用户流量一直在下跌?

文章深入分析DeepSeek和Anthropic策略,揭示行业计算资源稀缺难题。指出AI服务定价是延迟、吞吐量、上下文窗口三个指标的权衡,DeepSeek牺牲体验换研发,Anthropic提升‘智能密度’优化资源。

Founder Park
推荐文章7

多智能体自主规划模式性能提升:五大精准策略详解

本文基于多智能体React模式实践,剖析自主规划架构挑战,如工具调用延迟等。提出五大优化策略,像用流式XML替代FunctionCall、合理压缩上下文等,还介绍创意加速器AI绘画创作功能,为多智能体规划模式提供借鉴。

阿里云开发者
新闻资讯7

Mistral 为 Le Chat 新增远程智能体与 Work 模式

Mistral发布1280亿参数的Mistral Medium 3.5模型,在Vibe和Le Chat引入云端智能体能力,还在Le Chat新增Work模式。新模型可自托管,支持长上下文窗口。社区反馈积极,开发者认可,也有人嫌定价贵。

InfoQ
产品应用7

全靠Claude Code 10天赶工上线,Cowork 删用户11G文件不含糊!核心研发:长时间打磨再发布很难成功

Anthropic发布的Claude Cowork研究预览版问题频出,如删用户文件、易受文件窃取攻击等。与Claude Code相比,它交互繁琐、效率滞后。不过其核心研发认为长时间打磨再发布难成功,未来将以用户反馈迭代。

AI前线