Agentic性能」共找到 4426 篇相关文章

产品应用7

Supabase:百亿美元估值,vibe coding 的默认后端?

Supabase 以 Postgres 为核心,提供一站式后端服务,接近完成 5 亿美元 F 轮融资,估值 100 亿美元。它处于 Postgres 生态和 AI coding 趋势交叉点,产品路线图向 agent 倾斜,面临竞争、UE 等挑战。

海外独角兽
开源动态8

MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070 即可实时运行

面壁智能等发布 MiniCPM-o 4.5 技术报告,开放全双工全模态 API。该模型 9B 参数,RTX5070 可实时运行,下载量超 25 万。报告披露 Omni - Flow 框架,模型性能强,还能催生新应用。

AI前线
产品应用8

国产模型编程能力卷到这个程度了?MiniMax-M2.5 深度实测

文章深度实测MiniMax-M2.5编程能力,用其开发多款游戏和点名工具,结果出色。还分析其底层技术,如原生Agent RL框架、过程奖励机制等,指出它性价比高,虽有不足但值得关注。

AI产品黄叔
产品应用8

Anthropic 深夜祭出 Claude Sonnet 4.5,能自主工作 30 小时!CEO:它更像你的同事

昨夜凌晨,Anthropic 推出新一代模型 Claude Sonnet 4.5,官方称其是世界上最好的编码模型等。该模型性能跑分登顶,工程落地能力强,还带来产品生态升级,开放 Agent SDK,误报率降低,价格亲民。

InfoQ
产品应用8

这一次,天玑9500的端侧AI能力,友商赶不上了

9月22日,联发科推出天玑9500芯片,展示新形态端侧AI应用,推动端侧AI实用化。其性能强、功耗低,还支持端侧模型训练。多家手机厂商将发布搭载该芯片的手机,展现新AI趋势。

机器之心
算法论文8

奖励模型也能Scaling!上海AI Lab突破强化学习短板,提出策略判别学习新范式

上海人工智能实验室提出策略判别学习(POLAR)新范式,解决奖励模型设计与训练瓶颈。POLAR可灵活适配多样需求,弥补传统奖励模型短板,契合强化微调框架,实验证明其性能和泛化性优越。

量子位
新闻资讯7

Transformer八子初创:AI横扫NP难题竞赛,Top 2%选手竟是智能体!

Transformer作者Llion Jones初创公司测试AI智能体,其在NP难题竞赛中排第21。Sakana AI与AtCoder合作构建ALE - Bench,设计ALE - Agent参赛成绩优异,不过它也有调试难等局限,未来待改进。

新智元
推荐文章8

AI数据工程师在应用中如何"返璞归真"

文章反思‘知识库+Prompt工程+工具调用’轻量级Agent构建模式局限,指出其难应对知识质量、语义理解与规模化维护挑战。提出从‘Prompt驱动’到‘上下文工程’、从‘搭积木组装’到‘全链路闭环’的范式跃迁,并介绍MktAI知识体系建设。

阿里云开发者
算法论文8

重新思考RLVR中的熵正则:从探索不足到探索过度的破局之路

2024年以来,RLVR使大模型在推理任务有显著突破,但实践中探索机制易失衡。传统熵正则化在LRM场景易走向极端,研究团队提出SIREN方法精准调控探索,实验显示其在多模型和数据集上性能提升显著。

深度学习自然语言处理
开源动态8

混元3D开源端到端全景深度估计器,代码+精选全景数据已上线,在线可玩

全景深度估计在3D视觉领域日益受关注,但因全景数据稀缺、球面畸变问题,以往方法零样本泛化和效率不佳。腾讯混元3D团队提出DA²,通过数据扩充引擎和SphereViT架构,提升性能,展现SOTA表现。

量子位