多模型轮转」共找到 9702 篇相关文章

算法论文8

腾讯混元团队最新研究:让 AI 从「固定模型」走向「实时适配系统」

腾讯混元团队提出论文《HY-WU (Part I)》,尝试让模型在推理阶段根据输入实时动态生成适合任务的参数,而非依赖固定参数。通过类实验验证,这种方式在图像编辑等任务中有明显优势,还降低了训练复杂度。

AI科技评论
开源动态7

MotlBot作者被Claude刁难后:MiniMax M2.1是最优秀的开源模型

Moltbot热度不减,开发者挖掘其实用价值,阿里云、腾讯云上线相关云服务。Moltbot作者Peter接受采访,分享项目起源、开发思路等,认为MiniMax M2.1是优秀开源模型,还探讨了智能体发展及项目后续规划。

量子位
新闻资讯8

百年黎曼猜想被Claude破了新纪录!是个未公开新模型

A社官宣未公开的Claude研究模型在黎曼猜想取得重大进展,将满足猜想的黎曼ζ函数零点比例下界从41.6%提高到67.2%。它靠60个智能体、3100万输出Token完成研究,几乎走完科研流程。

量子位
新闻资讯8

智谱定档大模型第一股,1月8日挂牌上市,IPO预募资43亿港元

智谱定档2026年1月8日在港交所主板挂牌上市,预募资43亿港元,上市后市值预计超511亿港元。它是中国最早开展LLM研发的公司,模型表现亮眼,靠MaaS模式实现盈利,但研发投入巨大。

量子位
开源动态8

如何在24GB显存里,塞下一个万亿参数的巨兽?KTransformers入选顶会SOSP

清华大学与趋境科技联合研发的KTransformers系统,可让消费级显卡跑万亿级参数模型,其论文入选SOSP 2025。该系统解决MoE模型本地部署难题,技术创新,还与SGLang合作,提升硬件利用率。

AIGC开放社区
产品应用8

「香蕉革命」首揭秘!谷歌疯狂工程师死磕文字渲染,竟意外炼出最强模型

谷歌最新图像模型nano banana横空出世,能融合图片、理解地理等结构,实现轮创作。它凭借Gemini知识与交错生成技术,重塑AI图像生成边界。谷歌团队揭秘其技术,还谈及未来发展方向。

新智元
算法论文8

模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨 22.4%!

Qwen团队、清华和南洋理工研究打破传统认知,揭示‘对齐税’现象。提出Confident Decoding策略,在架构和评测集实验中表现出色,开销低,挑战‘LLM最后一层最优’常识。

量子位
算法论文8

破解MoE模型“规模越大,效率越低”困境!中科院自动化所提出新框架

模型参数量飙升却陷入‘规模越大,效率越低’困境,中科院自动化所研究团队提出统一框架,直击MoE底层运作模式,让专家‘组队学习’,实现参数量、负载方差降低,达成三重优化。

量子位
新闻资讯8

Sam Altman:即将推出远超预期的开源模型,ChatGPT记忆功能正在实现《Her》的愿景

Sam Altman在对话中透露OpenAI将发布‘远超预期’开源模型,分享创立初期挑战,明确GPT - 5等演进方向,展望AI伴侣、机器人发展,还向创业者喊话,强调AI用于科学前景。

AI寒武纪
产品应用8

刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

阿里巴巴突袭发布新一代基座大模型Qwen3.8 - Max,它总参数量达2.4万亿,在场景表现出色,在权威榜单冲进全球第一梯队,性能直逼Claude,且价格实惠,实测反馈良好。

量子位