编程型模型」共找到 8488 篇相关文章

开源动态8

荣登HuggingFace周榜首位, 人大高瓴与快手提出ARPO实现智能体高效训练!

人大高瓴与快手提出的ARPO项目受高度关注,荣登Huggingface Paper日榜、周榜双首位。它是为多轮交互LLM智能体设计的强化学习算法,在基准测试中,用一半工具调用预算就显著优于现有方法。

PaperAgent
推荐文章8

骂谷歌干蠢事、炮轰甲骨文、AI在真实数据库测试得分为0!83岁图灵奖数据库教父的硅谷“狂人日记”

本文是对图灵奖得主、Postgres 奠基者 Mike Stonebraker 的访谈。他直言大模型 Text - to - SQL 在真实数据库测试得分低,批评谷歌、甲骨文等公司做法,还探讨数据库未来,如 Agent 读写与数据库结合、DBOS 技术等。

AI科技大本营
产品应用9

我给阶跃星辰 Step 5 Preview 出了一道工程题

本文作者池建强参与阶跃星辰新一代旗舰大模型Step 5 Preview小范围内测,设置带两层bug和隐藏需求的编码工程题,与Qwen 3.8 Max、Kimi K3对比测试,分享实际项目使用体验,给出客观评测。

MacTalk
产品应用8

谷歌Gemini 2.5全线爆发!勇战「濒死恐慌」,却被丝血宝可梦吓到当场宕机

谷歌旗舰Gemini 2.5全家桶三款模型昨夜上线,包括正式版2.5 Pro、2.5 Flash及预览版2.5 Flash - Lite。技术报告显示其性能提升显著,还在玩宝可梦时惊现类人恐慌,推理性能下降。

新智元
新闻资讯8

刚刚,Opus 5来了:性能不输 Fable 5、价格砍半

Anthropic 发布新一代模型 Claude Opus 5,其智能接近 Claude Fable 5 但价格减半。它在编程、知识工作等评测中表现出色,科研能力进步大,自主性与严谨性更强,安全对齐度高,防护兼顾安全与可用。

机器之心
产品应用8

把20多种工具塞进一个搜索框!亲测「Agentic Search」后,我关掉了几十个浏览器标签页

秘塔AI推出Agentic Search,是“边想边搜,边搜边做”新搜索方式,能自主完成多步工具调用。作者测试其为AI笔记应用策划预热活动等场景,还测市场分析、编程学习、新媒体运营场景,虽有不足但未来可期。

AI寒武纪
新闻资讯7

双“雷”暴击!Trae 被曝资源黑洞、Claude背刺超级付费党,开发者们被“刀”惨了

主打“自动化执行、多模型调用、上下文记忆”的AI编程应用大热,但也出现运行卡顿等问题。Trae被曝过度消耗资源,Claude Code对付费用户增加调用限制,凸显AI产品资源问题及厂商成本管控困境。

AI前线
新闻资讯7

一句“Hi”,80$蒸发!O3-Pro:地表最强,也最“坑”的AI!

昨晚ChatGPT宕机,OpenAI 2折甩卖o3模型并发布o3 Pro。o3 Pro编程能力强,达全球top150程序员水准。官方称甩卖的o3是原版但推理快近40%。o3使用成本高,还需足够上下文。

探索AGI
产品应用7

别再无脑开高推理!Opus 5高配会擅自重构代码乱加戏

有人用FrontierCode编程基准测试Opus 5推理档位,发现性能顶峰在medium档,高档位推理预算多余,会让模型反复校验、偏离需求,在代码场景还会擅自重构代码。Anthropic也建议调低推理档位。

量子位
算法论文8

UC伯克利新作颠覆认知:LLM靠「自信爆表」学会推理?无需外部奖励超进化

UC伯克利华人团队发现,LLM不靠外部奖励,仅靠「自信爆棚」就能学会复杂推理。他们提出基于内部反馈的强化学习(RLIF)新范式,用INTUITOR方法让模型用自身置信度作内在奖励,在多任务中表现良好。

新智元