测试时深思」共找到 2292 篇相关文章

开源动态8

腾讯开源智能体新框架:不用训练无需充值,用开源模型实现SOTA Agent

智能体框架是推动智能体生态发展的基础设施,但现有框架存在上手门槛高、依赖闭源模型等问题。腾讯优图实验室开源Youtu - agent框架,无需训练模型、不依赖闭源API,性能领先,有多个核心亮点和典型应用案例。

量子位
开源动态8

美团开源新模型,多项能力实测第一

美团发布5600亿参数的LongCat - Flash模型,有创新动态计算机制和高效训练推理架构。它在多项测评中领先,尤其在代理工具使用测试表现出色,还以宽松许可开源,降低使用门槛。

AIGC开放社区
新闻资讯7

Claude翻车:Opus 4.1白天退化,Anthropic承认并回滚更新

发布即拿下各项SOTA的Claude Opus 4.1翻车,用户反馈其变得迟钝,官方承认处理某些请求质量退化,如白天推理性能下降,使用限制不明确,还会暴露API密钥,官方已回滚版本。

量子位
新闻资讯8

马斯克首个编码模型上线,编程飙进Top5!这9位华人天团爆肝打造

xAI上线首个编码模型Grok Code Fast 1,速度快且性价比高,在编程基准测试中冲进前五。它全栈开发能力出色,背后核心团队华人学者占多半,xAI还给出提示词编写指南。

新智元
产品应用7

狂肝一周,测评十余款 PPT AI 生成产品的真实反馈

评估 Agent 产品能力复杂,以 PPT 生成为例,有 Agent 和模板化两种流派。作者选前者投票测评、后者全方位测试。给出方案,还推荐不同需求适用产品,附总榜单和细致体验描述。

特工宇宙
算法论文8

思维链可无限延伸了,MIT等打破大模型上下文天花板

MIT等机构提出新架构Thread Inference Model(TIM),配合专用推理引擎TIMRUN,把推理过程变为树状递归子任务结构并修剪子任务,让模型突破输出窗口限制实现长程推理,实验验证了其性能。

量子位
新闻资讯8

强化学习之父Richard Sutton最新演讲揭示OaK架构:通向超级智能的八步愿景

强化学习之父Richard Sutton在演讲中介绍OaK架构,认为它是通向超级智能的路径。他回顾对简单通用AI智能体架构的追求,强调从经验学习、拟合世界的重要性,还指出实现该架构需八个步骤,虽只是愿景但提供了发展路线图。

机器之心
开源动态8

谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草

大模型代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。

新智元
新闻资讯7

宇树机器人“撞人逃逸”火到国外,王兴兴回应:下次不遥控了

宇树机器人“撞人逃逸”片段在国外疯传,引发对机器人安全性的担忧。分析发现,“元凶”可能是人类控制员交接遥控器未及避让。宇树创始人王兴兴表示下次让机器人自主奔跑,还透露未来有更多突破。

量子位
算法论文8

华人团队终结Token危机:扩散模型数据潜力超自回归三倍

最新研究发现,token数量受限下,扩散语言模型数据潜力超自回归模型三倍多。一个1B参数的扩散模型用1B tokens训练,在基准测试取得不错准确率,且未现性能饱和。

量子位