多模型策略」共找到 9909 篇相关文章

算法论文8

2026开年关键词:Self-Distillation,大模型真正走向「持续学习」

2026年刚开场,Self - Distillation成大模型领域高频词汇。传统强教师依赖范式难适配大模型持续进化,MIT等顶尖机构发布三项成果,用不同方法实现自蒸馏,推动模型持续学习。

机器之心
推荐文章7

智能投顾的大模型应用,为什么选择了“大小模型协同”?

模型时代,金融智能投顾落地是技术与业务安全的双重挑战。北银金科高级算法专家尹辰轩表示采用“大小模型协同”架构,能在性能、准确性与合规间找平衡,还阐述了架构亮点、问题解决办法等。

InfoQ
算法论文8

ICLR 2026 Oral|大模型总爱「想太」? DECS从源头消除冗余思考,实现推理token减半且性能不降反升

以DeepSeek - R1等为代表的大型推理模型存在过度思考问题,造成大量冗余计算。复旦大学等团队在ICLR 2026 Oral论文中揭示‘长度惩罚’局限性,提出DECS框架,在基准测试中实现推理长度减半且性能提升。

机器之心
产品应用8

阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了

阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生模态设计,解决“内存墙”问题。在基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。

AI工程化
开源动态8

Qwen3家族训练秘籍公开:思考/非思考融进一个模型,大模型蒸馏带动小模型

Qwen3技术报告揭晓8款模型关键技术,采用双模式架构,训练和微调分段进行,还“大带小”蒸馏数据。其融合思考与非思考模式,训练分阶段,Qwen Chat还全量上线深度研究功能。

量子位
新闻资讯8

硬核「吵」了30分钟:这场大模型圆桌,把AI行业的分歧说透了

在WAIC 2025大模型论坛的“模型之问”圆桌中,位行业大佬围绕大模型展开辩论,话题涉及训练范式、模型架构、数据、开闭源等核心问题,不同观点碰撞,深入探讨大模型技术演进与发展之路。

机器之心
新闻资讯7

神秘模型「Pony Alpha」引外网热议,它会是国产大模型中的谁?

近日,全球模型服务平台OpenRouter上搜索第一的神秘模型「Pony Alpha」引外网热议,它是新一代通用大模型,在方面表现突出且可免费使用。网友、AI猜测其身份众说纷纭,已有人用它做出惊艳案例。

机器之心
算法论文8

基于DINOv2和SAM2改进的U-Net模型

DSU-Net是基于DINOv2和SAM2改进的U-Net模型,通过尺度跨模型特征协作和轻量级适配器模块,解决现有图像分割模型在特定下游任务表现不足问题,提升分割精度,降低训练成本。

机器学习AI算法工程
新闻资讯8

英伟达发布了跨 AI、机器人和自动驾驶的开放模型、数据集和工具

英伟达发布涵盖领域的开放模型、数据集和开发工具,扩展模型家族。代理式AI领域扩展Nemotron;机器人技术引入Cosmos;自动驾驶有Alpamayo;医疗保健有Clara相关模型。均开放许可,可经GitHub等访问。

InfoQ
算法论文7

SSM+扩散模型,竟造出一种全新的「视频世界模型

在AI热词不断涌现的时代,斯坦福大学等机构研究将长上下文、状态空间模型、扩散模型等结合,创造全新「视频世界模型」。它用状态空间模型实现长期记忆,还设置局部注意力机制,训练和推理表现出色。

机器之心