前端开发测试」共找到 3213 篇相关文章

算法论文8

不让“猪队友”拖后腿!哈深新作 AgentDropoutV2,专治多智能体“传话游戏”翻车现场

多智能体系统中,常有agent出错带偏整体。哈工大联合阿里提出AgentDropoutV2,测试时介入,设‘质检员’审核输出,结合失败案例构建‘避坑指南’,在多测试中显著提效,泛化性强。

深度学习自然语言处理
算法论文8

一篇92页大模型Vibe Coding技术全面综述

中科院计算所&杜克大学发布首篇Vide Coding技术全面综述。介绍以“氛围/结果”为导向的Vibe Coding开发范式,含技术分类、能力分析、开发模式、数据模型等内容,还提及价值及反馈回路等。

PaperAgent
新闻资讯8

OpenAI深夜放出GPT-5狙击谷歌!基准测试碾压前代模型,价格比Claude更便宜

北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推两款新模型,介绍了不同用户套餐。它在编程基准测试表现佳,健康领域能力突出,引发各界热议。

AI前线
开源动态8

等了五年,AI 终端 Warp 终于开源!OpenAI 赞助

Warp是用Rust写的AI终端,其创始人Zach Lloyd宣布开源,代码已推到GitHub。OpenAI是开源仓库「创始赞助商」。开发瓶颈转移,Lloyd提出开放智能体开发模式。Warp还内置编程Agent,有云端Agent编排平台Oz。

AGI Hunt
算法论文8

图像编辑模型不止生成:BIGAI&上交大提出EAR范式,系统测试其视觉规划能力

上海交通大学联合北京通用人工智能研究院提出EAR范式,构建AMAZE基准,分析图像编辑模型视觉推理能力。研究发现模型零样本表现弱,扩散式模型更适合视觉规划,CoT效果不稳定等。

AI科技评论
产品应用7

使用最新的 Claude 4,我用两天就开发出一个视频编辑器,但却无法维护

作者用Claude 4两天开发出视频编辑器,却难维护。分析原因,指出AI编程在模块级强,但系统层面不足,还列举网友讨论,探讨AI在软件工程各方面的能力及局限。

宝玉AI
产品应用7

如何用AI Coding和Claude Code提升开发效率?看我的全流程复盘

作者分享用AI Coding和Claude Code提升开发效率的经验。先谈AI Coding,如Prompt工程心得、划分任务边界等;后讲Claude Code使用,包括安装、指令、构建项目规则等,还提及它在多场景的应用。

阿里云开发者
开源动态8

红杉中国推出 Agent 基准测试「xbench」,双轨评估体系,关注 AI 真实场景的效用

红杉中国开放AI和Agent基准测试工具「xbench」,采用双轨评估体系,构建多维度测评数据集。首期发布两个核心评估集并排名,提出垂类Agent评测方法论。该工具旨在解决现有评估问题,关注AI真实场景效用。

Founder Park
8

专业医生远不如AI模型?OpenAI推出医疗开源测试基准HealthBench,o3表现最强

OpenAI推出医疗开源测试基准HealthBench,由262位多国医生合作打造,含5000段真实健康对话。评估显示o3综合表现最佳,顶尖AI处理任务能力超无辅助医生,HealthBench更真实专业有区分度,但也有局限。

AI寒武纪
新闻资讯7

Claude 吞噬整个AI编程栈?“Vibe Coding 公司的最大错觉是以为自己有护城河”

近日网友爆料 Anthropic 开发类似 Lovable 功能,要构建全栈式 Vibe 编码平台。此前 Claude Code 源码泄露,显示 Anthropic 补齐 AI 开发栈。AI 编程进入‘大收割时代’,模型厂商吞噬工具趋势显现,Lovable 等面临挑战。

AI前线