小模型推理能力」共找到 9384 篇相关文章

算法论文8

Agent进入下一篇章!Alita:不靠人工预设,自己造工具,成绩碾压OpenAI

当前AI Agent依赖人工预设,存在工具不够用、缺乏创造力、兼容性差等问题。Alita秉持少预设多进化理念,用MCP协议,架构含三大模块,实验成绩超OpenAI,还能让小模型提效。

深度学习自然语言处理
新闻资讯8

OpenAI连破10道数学难题,Fable 24小时「复现」5道

这个周末,OpenAI与Anthropic两大AI巨头在数学前沿短兵相接。先是OpenAI用未发布模型Astra证明10项数学成果,不到24小时,Anthropic的Fable复现了其中5项。AI解难题成本降低,成果验证成新考验。

新智元
产品应用8

30 小时不眠不休写代码,Claude 4.5 的三个“最佳”

Anthropic发布Claude Sonnet 4.5,宣称其为“世界上最好的编码模型”等。它在测试中表现出色,能力全面提升,价格实惠,开发者测试效果佳。还注重安全,升级开发工具和生态系统。

AIGC开放社区
推荐文章8

北大校友,OpenAI前安全副总裁Lilian Weng最新万字博客文章:Why We Think

北大校友Lilian Weng新发布万字博文《Why We Think》,系统梳理让AI模型‘多想一会儿’的前沿方法及逻辑,深入剖析多种机制突破AI性能瓶颈的理论、技术与进展,还提出一系列待解决的开放性问题。

AI寒武纪
开源动态7

HarnessEval 来了!开启 RSI 时代的新评测范式!

过去一年AI进入RSI时代,但评测方式仍停留在过去。MirroS联合多方发布HarnessEval,将Harness引入评测领域,使评测成为具备自我进化能力的智能系统,还率先应用于交互式世界模型评测。

特工宇宙
算法论文7

Transformer与RNN合体,谷歌打下显存门槛,解锁超长上下文

谷歌论文提出 Memory Caching 技术,通过架构机制创新赋予 RNN「可生长的记忆容量」,兼顾 Transformer 与 RNN 优势,能处理更长文本、降低推理资源门槛,实验显示有良好效果。

机器之心
产品应用7

OpenClaw一战封神,给大家分享6种官方不会告诉你的神级技巧。

作者分享OpenClaw深度使用体验与6种实用技巧,如本地文件管理、个人知识库管理等,对比多模型后选Claude Opus 4.5为主力,还提及适配Mac及后续计划。

数字生命卡兹克
产品应用7

Cursor 免费平替:Gemini Code Assist (附开启隐藏 Agent 模式教程)

文章介绍了 Cursor 的免费平替 Gemini Code Assist,可在多种 IDE 免费使用,基于 Google 先进的 Gemini 模型。还给出安装指南,以及开启隐藏 Agent 模式教程,开启后能调用 MCPs 增强能力

AI寒武纪
推荐文章8

Karpathy力荐必读博客:代码功底,决定AI「开挂」倍数!

Karpathy推荐Atharva博客,指出AI是工程师能力放大器,扎实编程基础搭配精准提示,能借AI打造极致产品。文章还给出用AI开发的策略、战术,以及数据库优化实例。

新智元
开源动态8

彻底告别VE与VAE!商汤硬核重构多模态:砍掉所有中间编码器

商汤科技联合南洋理工大学发布NEO - unify,这是“原生、统一、端到端”多模态模型架构,砍掉VE和VAE,用混合变换器架构打通视觉与语言能力,提升数据与算力利用效率,为跨模态智能系统奠基。

量子位