性能 - 效率权衡」共找到 2923 篇相关文章

算法论文8

用「传心术」替代「对话」,清华大学联合无问芯穹、港中文等机构提出Cache-to-Cache模型通信新范式

随着大语言模型发展,多智能体系统中现有T2T交流方式有信息丢失、语义模糊、延迟大问题。清华等团队提出C2C信息传递方式,以KV - Cache为媒介,提升了正确率和速度,还介绍了实现路径、优势及应用前景。

机器之心
算法论文8

天下苦VAE久矣:阿里高德提出像素空间生成模型训练范式, 彻底告别VAE依赖

当前主流图像生成技术训练范式依赖VAE,带来训练复杂、微调成本高的问题。阿里高德提出EPG,结合自监督预训练与端到端微调,去除对VAE依赖,在训练效率和生成效果上有突破。

量子位
算法论文8

奖励模型也能Scaling!上海AI Lab突破强化学习短板,提出策略判别学习新范式

上海人工智能实验室提出策略判别学习(POLAR)新范式,解决奖励模型设计与训练瓶颈。POLAR可灵活适配多样需求,弥补传统奖励模型短板,契合强化微调框架,实验证明其性能和泛化性优越。

量子位
推荐文章8

Data Agent如何帮助企业打造懂你的“电子牛马”?|数势xSelectDB

本文邀请数势科技谭李和飞轮科技肖康探讨数据Agent。谈到懂业务的Agent特点、与传统BI差异,还提及数据库挑战及应用场景,指出Agent能激活数据、提升交互效率,未来将催生新角色。

量子位
算法论文8

后生可畏!何恺明团队新成果发布,共一清华姚班大二在读

何恺明团队继5月提出MeanFlow (MF) 后,近日推出改进版Improved MeanFlow (iMF),解决了原始MF三大核心问题。它重构预测函数,还实现灵活的无分类器指导和高效的上下文内条件作用架构,提升了实用性和效率

量子位
算法论文8

重新思考RLVR中的熵正则:从探索不足到探索过度的破局之路

2024年以来,RLVR使大模型在推理任务有显著突破,但实践中探索机制易失衡。传统熵正则化在LRM场景易走向极端,研究团队提出SIREN方法精准调控探索,实验显示其在多模型和数据集上性能提升显著。

深度学习自然语言处理
新闻资讯7

突发!微软与OpenAI同日开火:语音之战+通用大模型,AI霸权决战打响

OpenAI发布语音大模型时,微软同日推出自研语音模型MAI-Voice-1和通用模型MAI-1-preview。MAI-Voice-1效率高、表达丰富,MAI-1-preview采用MoE架构。微软此举在语音战场布局,也为与OpenAI谈判增加筹码。

新智元
开源动态8

国产LLM又迎来一波开源潮:Qwen、华为盘古、腾讯混元、小米~

本周国产开源LLM集中爆发,Qwen、华为盘古、腾讯混元、小米等接连发布模型。如Qwen3 - 4B性能提升,Qwen - Image文生图能力强;华为开源盘古模型并宣布CANN开源;腾讯混元小尺寸模型特点多且已落地业务。

PaperAgent
产品应用8

Qwen3.8-Max首发上线阿里千问AI平台,API服务与Token Plan同步开放

今日,阿里巴巴发布新一代基座大模型Qwen3.8,千问AI平台首发其Max版API服务与Token Plan。Qwen3.8参数量2.4万亿,性能居前列,推理快且能自主编程。API性价比高,平台还为Token Plan用户提供优惠。

阿里云开发者
算法论文8

突破单token预测局限!南洋理工首次将多token预测引入微调,编程任务准确率提升11.67%

当前主流大语言模型依赖下一token预测训练,难理解跨多token完整概念。南洋理工大学提出概念感知微调(CAFT)技术,首次将多token预测引入微调,能让模型理解完整概念,多领域实验显示其可显著提升模型性能

量子位