推理时扩展」共找到 2919 篇相关文章

新闻资讯7

狂奔AGI,Claude年终封王!自主编码近5小震惊全网

METR报告称Claude Opus 4.5能持续自主编码5小,超OpenAI最强编程模型。AI编码智能体任务长指数级增长,不过迈向AGI仍面临长期记忆难题,未来一年该领域或有突破。

新智元
算法论文8

除了prompting外,不动参数,如何改变模型行为?

文章指出传统提示工程控制大模型生成行为有缺陷,提出Steering Target Atoms (STA)方法。它用稀疏自编码器分解LLM高维表示,定位“原子知识组件”精准控行为,实验效果超现有技术,还能控制推理长度。

深度学习自然语言处理
开源动态7

DeepSeek-R1今天一次「小更新」,颠覆了大模型格局,网友:尽快放R2

昨晚,DeepSeek官方宣布其R1推理模型升级到最新版本(0528),并公开模型及权重。该版本参数量高达6850亿,采用MIT许可证,性能提升明显,在多个基准测试中成绩优异,网友实测代码能力也大幅提升,但仍存在过度思考问题。

机器之心
开源动态8

1.2K Star!终于有工具开始认真解决 AI Agent 安全问题了!

作者深度使用AI Agent担忧其安全性,GitHub上斗象科技开源的ClawVault项目,上线不久获1.2K Star。它为AI Agent提供多场景安全隔离方案,有分格管理、可视化监控等实用设计,适配Python3.10+环境,安装方便。

开源星探
开源动态8

开启端侧长文本代!面壁全新架构,让小钢炮最快提升220倍

2025智源大会上,面壁智能发布MiniCPM 4.0模型,实现行业首个系统级上下文稀疏语言模型创新。它在端侧推理任务上表现出色,降低缓存需求,提高运行效能,还进行多维度架构创新,是AI领域探索高效率语言模型的里程碑。

机器之心
产品应用7

DeepSeek识图模式全量上线,却认不出自家老板梁文锋

端午节前,DeepSeek全量推送识图模式。测试发现,它能认出黄仁勋,但忽略‘豆汁’字样,识别人物和潦草汉字准确率低,不过识别文物能力不错。还比较了与其他模型在乐理推理测试中的表现,开发者有新疑问待解答。

机器之心
开源动态7

小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek

小米开源 MiMo-V2.5 和 MiMo-V2.5-Pro 两款模型,采用 MIT 协议,适合商业应用。在基准测试中表现出色,有竞争力价格和限优惠。但与 DeepSeek 比,架构创新偏工程化,也有推理表现不足等问题。

AI前线
算法论文8

腾讯混元团队最新研究:让 AI 从「固定模型」走向「实适配系统」

腾讯混元团队提出论文《HY-WU (Part I)》,尝试让模型在推理阶段根据输入实动态生成适合任务的参数,而非依赖固定参数。通过多类实验验证,这种方式在图像编辑等任务中有明显优势,还降低了训练复杂度。

AI科技评论
新闻资讯7

Groupe SNCF 使用 Talos OS 和 Kubernetes 实现基础设施的现代化

法国国家铁路集团(Groupe SNCF)从传统 VM 的 Kubernetes 部署迁移到基于 Talos OS 和 OpenStack 的云原生平台,解决运维挑战。虽面临组织和技术难题,但紧密合作加强了平台,未来将扩展平台、迁移关键应用。

InfoQ
新闻资讯7

因为不用AI写代码,我在终面挂了 | 一个程序员的奇葩面试经历

外国小哥面试终面,因表示工作不优先用AI,5分钟后收到拒信。此经历在网上引发讨论,网友看法不一,有人支招面试别贬低AI,也有人探讨AI在编程中的利弊,还提到AI辅助面试应用。

量子位