开源动态8
VISTA:评测AI开发产品能力的Benchmark
机器之心
AI 摘要
多校研究团队推出 VISTA,首个面向 Visual Spec-to-Web-App Coding Agents 的端到端 Benchmark。它从多维度评测 Coding Agent 开发能力,持续更新记录其能力演进,推动软件工程评测从代码走向产品。
阅读原文 · 机器之心
Claude、GLM、GPT谁才是真正的AI软件工程师?首个持续更新Visual Spec-to-App Benchmark发布
近年来,Coding Agent 发展迅速,「AI 软件工程师」渐成现实。但目前缺少系统评测其从设计稿开发产品能力的公开 Benchmark。为此,多校研究团队推出 VISTA,可多维度评测 Coding Agent 开发能力,且持续更新。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
开源动态8
近5w星!Orca可同时指挥多AI写代码
现在写代码,很多人想开多个AI助手。Orca是支持多AI Agent的编程开发环境,各Agent在独立git worktree里运行,互不干扰。它功能丰富,还支持多系统安装。
GitHubStore
产品应用7
Cherry Studio:从Chat到Agent的产品重构
Cherry Studio最初是为用户在不同大模型间切换的聊天客户端,随行业从Chat转向Agent,它开启2.0版本重构,定位转向「个人Agent平台」,底层架构重写,要解决产品复杂性、完善协作等问题。
Founder Park
新闻资讯7
InfoQ:AI 重写工程师角色,一切仍关乎人
InfoQ 2026 年趋势报告探讨了 AI 对软件开发的影响,包括重写工程师角色、团队演变等。嘉宾指出 AI 采用应结合风险和业务场景,巩固基础,重新设计审查流程,关注质量和人的因素。
InfoQ
产品应用8
MemoraX Code 让 Coding Agent 拥有长期记忆
过去一年,Coding Agent 改变开发者写代码方式,但进入长期开发仍会遗忘项目经验。MemoraX Code 试图解决此问题,构建了本地与云端记忆,让关键信息能被识别召回,且在赛事中表现出色,还能沉淀工程经验。
机器之心