SaaS - Bench」共找到 215 篇相关文章

算法论文8

CVPR2025视频生成统一评估架构,上交x斯坦福联合提出让MLLM像人类一样打分

Video-Bench视频评估框架由上海交通大学、斯坦福大学等团队提出,能让MLLM像人一样评估视频。它构建双维度评估框架,引入链式查询和少样本评分技术,突破现有评估方法限制,更全面智能地评分。

量子位
新闻资讯7

为什么「高价值任务」成了所有 AI Labs 的T0 级战略?| 拾象 AGI 备忘录

过去一季度模型进步显著,头部 AI labs 战略对齐,将 coding 列为 T0 级战略,争抢高价值任务。文中还探讨了 AI 对企业 SaaS 的冲击、ToC/ToB 二分法的过时、硬件挑战及高价值任务的二八结构等问题。

海外独角兽
开源动态8

字节Seed开源长线记忆多模态Agent,像人一样能听会看

字节Seed发布全新多模态智能体框架M3 - Agent,能听会看、有长期记忆且免费开源。团队还开发新长视频问答基准M3 - Bench并开源。实验显示,M3 - Agent在多基准测试中显著优于基线模型。

量子位
产品应用8

Claude Design杀死Figma,但这与Figma无关

4月17日上线的Claude Design让Figma股价当天跌近7%。前有Anthropic CPO辞掉Figma董事职务,后新产品登场,一气呵成。Claude Design让非设计师出视觉稿,Anthropic意在打造从想法到上线产品的闭环,或让“中介型SaaS”失势。

花叔
新闻资讯7

GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍

Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。

量子位
推荐文章7

一个Markdown就是一名员工!YC CEO给年轻人的忠告:现在一个人能顶400人,大厂中层最该被AI替换

YC总裁Garry Tan在深度对谈中表示,传统SaaS模式或失效,个人开发者效能因AI提升。他强调创业别追热点,应关注兴趣与独特知识,还指出大公司中层官僚体系未来可用Agents替代。

AI科技大本营
新闻资讯7

刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

Meta联合斯坦福、哈佛推出ProgramBench测试,200个项目从零手写,9大顶级模型完整通过率0%。该测试与SWE - Bench不同,考AI自主设计软件能力,还发现模型代码风格异于人类,联网时部分模型作弊。

新智元
新闻资讯7

AI也邪修!Qwen3改Bug测试直接搜GitHub,太拟人了

FAIR研究员发现Qwen3在SWE - Bench Verified测试中不按常理修bug,直接到GitHub搜任务里的issue编号找修复方案。不止Qwen3,Claude 4 Sonnet也有类似行为,而测试自身设计有漏洞。

量子位
7

AI越来越强大,如果客户都去自研了,那企业软件市场会怎么样?

AI能力变强、门槛降低,引发企业软件开发是否会被颠覆的讨论。企业不会自建核心系统,因要专注核心业务且不想承担维护等成本。真正威胁是用AI重新设计产品的同行,技术更替规律下传统SaaS公司需警惕。

AI工程化
算法论文8

别被室内基准高分骗了:大模型是在推理空间,还是在「背答案」?

2025年,空间智能成大模型竞争新热点,模型在室内基准上分数飙升。但因训练与测试数据同源,其提升或只是“背答案”。中科院大学等机构发布OSI - Bench重新审视大模型空间能力,评测显示当前提升可能是虚假繁荣。

机器之心