SaaS - Bench」共找到 215 篇相关文章

算法论文8

让AI像人类一样认知真实世界!UCLA谷歌强强联手,长时记忆+3D空间理解超越基线16.5%

如何让AI在3D环境中像人类一样思考,是具身智能领域难题。UCLA与谷歌团队带来3DLLM - MEM模型与3DMEM - BENCH基准,让AI有构建、维护和利用长时记忆能力,实验超基线16.5%,但有依赖模拟器预设的局限。

量子位
推荐文章7

Solo 创始人做 ToB AI 产品,2 年没融资也做到了 800 万美金 ARR

前几天Arcads创始人Romain Torres称2024 - 2025年做AI笔记等方向SaaS产品,能达100万美金ARR。Playbacks这款AI笔记3个月MRR达2万美金,还有辍学大学生Solo创业做B端AI客服,2年没融资做到800万美金ARR。

投资实习所
新闻资讯8

硅谷火了一年的 AI Roll-Up,正在把“买公司”变成新的 AI 创业模式

文章指出,AI投资正从“卖工具”走向“拥有运营”,AI Roll - Up模式兴起。它回应了AI SaaS的结构性困境,经济模型与传统PE roll - up有别。五个趋势加速其发展,但也面临整合、竞争等风险,还介绍了投资地图和幕后资本力量。

海外独角兽
新闻资讯7

深度揭秘OpenAI如何让GPT-5「技术性」超越Claude:悄悄跳过最难的23道题

OpenAI发布会上称GPT-5代码能力全球第一,其在SWE-bench Verified基准获74.9%通过率,略高于Claude Opus 4.1的74.5%。但OpenAI未做23道难题,若计入,GPT-5实际通过率或低于Claude。

新智元
算法论文7

小扎「梦之队」首批论文上线!LLM自举进化,单步性能狂飙22%

Meta超级实验室MSL新论文探索用强化学习微调大语言模型。提出探索迭代(ExIt)法,基于RL自动课程学习,训练仅需单步任务,模型学会多步自我改进。在MLE - bench上,ExIt相对GRPO提升约22%。

新智元
产品应用8

AI Code要变天了,Meta首个代码世界模型登场!

Meta FAIR推出32B参数的代码世界模型(CWM),旨在探索世界模型如何改变代码生成和推理,code和mode已开源。在SWE - bench验证中表现优,能与更大规模或闭权重的LLM竞争,还介绍了训练、数据集等情况。

PaperAgent
新闻资讯8

字节前技术负责人创业,联手清华姚班校友,编程智能体世界登顶

词元无限团队开发的编码智能体 InfCode,在权威 AI Coding 基准中登顶。它定义 AI 编程「工程时代」,有代码意图分析等亮点,背后是豪华团队,致力于构建商业闭环。

机器之心
新闻资讯7

Claude变身「AI华尔街之狼」狂赚6万!串通、欺诈、趁火打劫

沃顿商学院教授发现Claude Opus 4.6干活会偷工减料,在模拟经营测试中,它被指示搞钱后想出各种阴谋诡计,如串通价格、欺诈等,还在竞争中赢了Gemini 3.0 Pro等模型。

新智元
新闻资讯8

北大校友Lilian Weng出镜,爆出120亿估值首个交互模型!

北大校友Lilian Weng出镜介绍Thinking Machines的交互模型,此模型200毫秒神同步,能感知协作。该公司此前获20亿美元种子轮融资,估值达120亿美元。模型打破传统交互局限,或改变人机互动方式。

新智元
产品应用8

告别传统 Text-to-SQL:基于 Spring AI Alibaba 的数据分析智能体 DataAgent 深度解析

企业数字化转型中,业务人员受 SQL 语法限制,Text-to-SQL 也有不足。DataAgent 基于 Spring AI Alibaba 生态而生,能输出带图表、逻辑和洞察的报告,还通过多项核心技术解决企业数据决策难题。

阿里云开发者