推理优化与部署」共找到 3538 篇相关文章

算法论文8

告别微调!腾讯提出Training-Free GRPO:无需更新参数,还能保证泛化性,成为传统RL的有力替代

大型语言模型在专业领域表现不佳,传统微调方法成本高、易过拟合。腾讯优图实验室提出Training - Free GRPO,无需更新参数,通过上下文学习提升性能,成本低且泛化性好,是传统强化学习有力替代。

深度学习自然语言处理
算法论文8

破解MoE模型“规模越大,效率越低”困境!中科院自动化所提出新框架

大模型参数量飙升却陷入‘规模越大,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化

量子位
开源动态8

谷歌开源非结构化数据抽取工具

谷歌开源 Python 库 LangExtract,用 LLM 从非结构化文本文档提取结构化信息。它定位精确、输出可靠,针对长文档优化,有交互式可视化,支持多模型,适应多领域,还给出快速开始示例。

GitHubStore
推荐文章7

AI Coding 的下半场,何去何从?

文章回顾AI Coding三年演进,指出2023年范式落地、2024年Coding Agent上位、2025年形态之争加速且CLI成主战场。分析项目“火爆”逻辑,提及市场数据背书,还探讨应用与模型关系及技术堆栈。

AI科技大本营
算法论文8

理解帮助生成?RecA自监督训练让统一多模态模型直升SOTA

统一多模态模型在视觉理解和生成能力上不平衡,常理解强但生成弱。本文提出重建对齐(RecA)自监督后训练方法,不改动架构,用未标注图像训练,在多模型实验中提升性能,部分达SOTA。

机器之心
新闻资讯7

Cursor定价又更新,直接变成" 买API ",Coding 产品包月模式走不下去了

Cursor一年三变价,9月15号后个人版按模型推理用量计费,有Pro、Pro Plus、Ultra方案,还对大学生免费计划二次验证。因模型成本涨、竞争大,包月模式难以为继,多家编程工具都调整定价。

AI进修生
产品应用7

GPT-5-Codex 一手实测

OpenAI推出新编程模型GPT - 5 Codex,Every团队实测显示其表现狂野。它能动态选思考时间,可在不同开发环境无缝切换,代码审查更优。但也存在对任务挑剔、环境设置麻烦等问题。

AGI Hunt
开源动态8

快慢思考不用二选一!华为开源7B模型实现自由切,精度不变思维链减近50%

华为发布openPangu-Embedded-7B-v1.1,参数7B却有双重“思维引擎”。采用渐进式微调策略和快慢思考自适应模式,可自由切换快慢思考,在多评测中精度提升,思维链减近50%。还推出openPangu-Embedded-1B小模型。

量子位
开源动态8

苹果端侧AI两连发!模型体积减半、首字延迟降85倍,iPhone离线秒用

苹果在Hugging Face放出FastVLM与MobileCLIP2两条多模态主线。前者主打「快」,首字延迟压到竞品1/85;后者突出「轻」,体积减半。模型和Demo已开放,开发者可集成开发。

新智元
开源动态8

用短视频成本生成长视频,字节Seed新注意力机制让计算量降低85%

字节Seed与斯坦福等机构推出新模型,其新注意力机制MoC能让长视频生成计算量降低85%,质量不减且保持连贯性。团队将视频生成定义为上下文检索任务,提出MoC机制并阐述实现方法。

量子位