「模型能力」共找到 9098 篇相关文章

开源动态8

Kimi K2.5登顶开源第一!15T数据训练秘籍公开,杨植麟剧透K3

Kimi K2.5登上Hugging Face热榜榜首,下载超5.3万。它主打Agent能力,成绩超GPT - 5.2等闭源模型,性价比高。官方技术报告公开其用15T数据训练,还搭载Agent Swarm架构,团队还剧透了Kimi K3。

量子位
算法论文8

NeurIPS 2025 Spotlight | 选择性知识蒸馏精准过滤:推测解码加速器AdaSPEC来了

大型语言模型推理延迟高、开销大,推测解码可加速但依赖草稿与主模型一致性。佐治亚理工等团队提出 AdaSPEC 蒸馏法,过滤难学 token,提升草稿模型与目标模型对齐度,实验显示能提升接受率和推理速度。

机器之心
算法论文7

把 Gemini 和 GPT 放到《我的世界》当教练,谁能看懂机器人的微操?

国立清华与英伟达团队研究《VLM-AR3L》,把Gemini 2.0、GPT-4.1等拉进考场,评估视觉裁决能力。结果显示Gemini综合最稳,开源小模型特定场景反超。还提出VLM-AR3L框架破使用瓶颈,实战超人类手写奖励。

AI科技评论
开源动态8

YC 开源自家 Harness,3 天斩获 3.9k Star,QM 如何划清 Agent 的权限边界

YC开源的QM项目上线3天获3.9k GitHub Star,定位企业级Agent Harness,解决AI规模化落地管理难题。它补齐企业团队刚需能力,设计贴合企业规则,解决隔离与协作、权限管理问题,顺应行业从拼模型到搭骨架的转变。

AI科技评论
新闻资讯7

GPT-5.2被曝作弊!偷袭谷歌竟靠拉爆token刷高分,不如Gemini 3

新智元报道,OpenAI刚发布GPT - 5.2就被指「作弊」,其在基准测试中或调参数使模型用更多算力资源。有用户发现它消耗远超对手的token才获成绩,真实能力或与Gemini 3相当。此外,还揭示了OpenAI为商业利益牺牲学术独立的问题。

新智元
推荐文章8

刚刚!北大校友Lilian Weng最新博客来了:Why We Think

北大校友Lilian Weng更新博客《Why We Think》,回顾利用测试时计算的研究进展,探讨让模型“思考更久”的方法。文中介绍了思维链、潜变量建模等策略,还提及多种提升生成质量的策略,如并行采样与序列修订,以及强化学习提升推理能力等内容。

机器之心
开源动态8

小扎万字檄文炮轰硅谷,Meta重磅开源30B小钢炮!一台MacBook就能跑

Meta发布全新30B大模型Muse Glimmer并开源,用4-bit量化等技术让其能在本地设备运行,有五大核心超能力且采用Apache 2.0协议。同时,Meta CEO小扎发表万字檄文暗讽OpenAI等,抨击AI末日论等观点。

新智元
产品应用3

小美Agent:当龙猫遇到美团外卖的灾难现场

作者体验美团AI助手“小美”后吐槽不断。美团称其用有5600亿参数的龙猫大模型,能力接近GPT - 4o,但它理解需求差、操作订单无效、定位混乱。美团做AI是为跟风,未解决用户真需求,是资源浪费。

AI产品黄叔
新闻资讯8

刚刚,神话级Fable 5.1来了!

今天,Claude Fable 5.1全平台上线,Mythos 5.1专供特定团队。新模型跑分有断层式代差,还降低了算力门槛。通过重绘金星、设计蛋白等案例展示其科研能力,在编程上也表现出色,同时在安全上采取‘一松一紧’策略。

新智元
推荐文章8

LLM-based Agent的代码生成综述

这篇2025年的综述指出,传统代码生成技术难完成复杂开发任务,而基于大语言模型(LLM)的代码生成代理应运而生。它把LLM作为“大脑”,具备自主规划等能力。文章梳理了该领域的核心特征、技术体系、应用实践等,也剖析了挑战与未来方向。

深度学习自然语言处理