普通人做产品」共找到 2587 篇相关文章

算法论文8

拿着数学题的 PRM 来评判 Agent 调用工具,基本是行不通的!

目前评估体系多为结果导向,在工具调用上缺乏像样的PRM基准。Arizona State University和Intuit AI Research研究者推出ToolPRMBench,指出用数学题的PRM评判Agent调用工具行不通,还介绍了其构建方法、训练范式和实验结果。

深度学习自然语言处理
产品应用8

MiniMax Agent 开年更新,好的 AI 产品,需要让工具来适应人了

2026年初,Claude Cowork引发关注,开源社区跟进,Anthropic下调功能价格。MiniMax升级Agent,推出桌面端和网页端新功能。通过整理文件、翻译、小红书内容流水线等测试,展现其能力与局限,指出Agent应适应人的趋势。

Founder Park
推荐文章7

Manus 加入 Meta,1 年内公司价值 100 倍增长,他们对了什么?

Manus 加入 Meta 后公司价值一年涨百倍,其虽无自有模型却受海外巨头青睐。它靠增量思维获产业认可,借先发红利快速获高 ARR 与估值。后续应塑造爆款场景,创业者和大厂都可借鉴其思路。

Founder Park
推荐文章7

Scaling Law 仍然成立,企业搜广推怎么才能少踩“坑”?

InfoQ《极客有约》X AICon 直播邀请京东颜林等探讨生成式推荐落地洞察。指出搜广推场景 scaling law 成立且在上升,还分享大模型对搜广推的改变、架构成长方式,及平衡成本等方面的经验。

AI前线
算法论文8

Yann LeCun离开Meta后首篇论文?使用了宇树机器人研究

伯克利、纽约大学等团队发表论文,提出GenMimic方法,让机器人能零样本复现AI生成视频动作。Yann LeCun是共同导师之一。团队构建GenMimicBench数据集,经仿真和真实实验验证方法可行。

机器之心
新闻资讯8

Scaling Law 仍然成立,企业搜广推怎么才能少踩“坑”?

InfoQ《极客有约》X AICon 直播栏目邀请京东、荣耀等专家探讨生成式推荐落地洞察。指出搜广推领域 scaling law 仍成立,大模型改变特征工程等,还分享了系统架构、模型应用等方面经验及挑战。

InfoQ
算法论文8

美团LongCat扎扎实实了件难事:LLM数学新天花板AMO-Bench

美团LongCat团队联合高校推出AMO - Bench,用50道原创奥赛级难题评估LLM数学能力。它解决现有基准测试痛点,经四重把关构建,测试显示顶级模型表现不佳,也揭示模型提升空间大。

PaperAgent
开源动态8

AI点外卖哪家强,美团LongCat团队了个全面评测

美团LongCat团队发布贴近生活场景的大模型智能体评测基准VitaBench,以三大高频生活场景为载体,构建含66个工具的评测环境。评测显示现有智能体与应用需求差距大,该基准已全面开源。

量子位
产品应用7

为 OpenAI 秘密提供模型测试, OpenRouter 给 LLMs 了套“网关系统”

OpenRouter成立于2023年初,为用户提供统一API Key调用各类模型,OpenAI会用其秘密测试。平台token用量高速增长,还发布模型用量排行榜引关注。创始人认为大模型非赢家通吃,未来想成agent最佳推理层。

海外独角兽
新闻资讯7

狂砸百亿美元后,仅5%企业成功落地AI,他们对了什么?

企业在生成式AI领域投入数百亿美元,但95%的机构未获可衡量商业回报,此为「GenAI鸿沟」。原因包括工具缺乏学习能力、预算分配失衡等。少数成功企业聚焦高价值用例,选易部署工具,与供应商深度合作。

Founder Park