大模型融合」共找到 9335 篇相关文章

算法论文8

模型合体!上交&上海AI Lab&华师提出LED-Merging,拒绝「能力」与「安全」二选一

上海人工智能实验室等团队提出LED - Merging解决模型融合“安全 - 效用冲突”问题。该方法无需训练,像“神经元手术刀”,不牺牲专业能力还提升安全性,论文已被ACL 2025 Main Conference接收。

深度学习自然语言处理
开源动态8

杨植麟被梁文锋叫醒了!Kimi新模型发布即开源,1T参数全线SOTA

172天后,Kimi推出全新Kimi K2基础模型回应DeepSeek冲击。它为MoE架构,1T参数,激活参数32B,在多任务上领先,发布即开源,还分享技术细节,实测有亮点也待优化,展现回归之势。

量子位
新闻资讯8

4位图灵奖得主布道,2冠军机器人登台,“AI春晚”果然又高又硬

智源会堪称“AI春晚”,规格高看点多。4位图灵奖得主分享观点,长跑冠军天工和拳击冠军宇树G1机器人秀技能。会还发布“悟界”系列模型,RoboOS 2.0与RoboBrain 2.0开源,多方探讨下一代AI发展路径。

量子位
新闻资讯7

Altman 秀新模型“翻车”,谷歌补刀躺赢!OpenAI 前员工爆肝 3 天,编程再赢老东家模型

近期,OpenAI 携多款未公开新模型亮相。在 IMO 竞赛中,其宣称新模型获金牌,谷歌 DeepMind 的 Gemini Deep Think 也达金牌水平,但网友对二者评价不一。此外,‘o3 Alpha’疑上线,前 OpenAI 员工还在编程赛中击败 OpenAI 模型

InfoQ
新闻资讯7

阿里巴巴模型品牌统一为千问

今天,阿里巴巴AI总称和核心品牌统一为千问,涵盖基础与专业领域模型,千问APP是C端旗舰应用。今年除夕开源千问3.5,多款中小型模型上榜,春节用户下单近2亿次,DAU增成国民级助手。

千问Qwen
推荐文章7

分享2个模型省钱

文章分享两个模型API省钱技巧。一是文本转截图,适用于输入长输出短、费用花在输入token的任务;二是音频加速识别,OpenAI语音识别模型Whisper按音频时长收费,加速音频可省钱,还可包装成API服务盈利。

AGI Hunt
开源动态7

非Transformer架构的新突破,液态神经网络的推理小模型只用900M内存

谷歌提出的Transformer架构基本垄断模型,而初创公司Liquid AI研发的液态神经网络架构另辟蹊径。其发布并开源的LFM2.5 - 1.2B - Thinking模型,仅需900MB内存就能在端侧运行,性能优于Transformer架构模型,还降低了死循环生成比例。

机器之心
开源动态8

首个基因推理AI 横空出世!准确率飙至97%,彻底改变基因组学研究

多伦多学等团队发布全球首个基因推理AI模型BioReason,将DNA基础模型语言模型融合,准确率从88%提至97%,可解释基因组变异致病机制,有望上线Hugging Face,应用前景广。

AGI Hunt
算法论文7

Reasoning模型可以Self-Train!

当前模型依赖人类标注数据,成本高且扩展难。论文探讨模型自我纠错、自主进化可能,提出自我奖励训练(SRT),用投票共识代替人类标注。在数学数据集上有效果,但高难度数据集出现问题,作者给出解决办法并开源代码。

深度学习自然语言处理
新闻资讯7

利用Loop语言模型扩展隐式推理 | 直播预约

当前语言模型依赖显式文本生成推理,未充分利用预训练数据。将介绍最新工作Ouro,Loop语言模型家族,核心创新多,虽参数少却性能优,还会讨论其推理轨迹及模型Scaling新可能。

深度学习自然语言处理