多模型策略」共找到 9929 篇相关文章

推荐文章8

Anthropic:这样构建Agent,性能提升90%!

Anthropic分享从0到1构建智能体DeepResearch系统的方法,该系统是Claude内置Research功能。干货,涵盖架构设计、Prompt工程等。智能体性能比单模型高90.2%,但烧钱,适合高价值复杂任务。

探索AGI
开源动态8

Qwen新开源,把AI生图里的文字SOTA拉爆了

通义模型家族新开源图像生成模型Qwen - Image,是通义千问系列首个图像生成基础模型。实测其对提示词理解到位,文字渲染高保真。它具备复杂文本渲染、一致性图像编辑能力,在基准测试达SOTA。

量子位
新闻资讯7

OpenAI推迟开源大模型发布

OpenAI联合创始人兼CEO Sam Altman宣布本周不发布开源模型,因需更安全测试。他曾透露要推可下载、自主运行且能力强的开源模型,此前6月也因安全测试推迟发布。

AIGC开放社区
推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【十】| “过拟合” 与 Dropout

文章围绕神经网络过拟合问题展开,介绍了过拟合的概念、危害及产生原因,阐述了缓解过拟合的正则化方法,重点介绍了Dropout随机失活,还指出其局限性及在大模型中的应用策略

AI大模型应用实践
算法论文8

Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力

上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在任务测试中全面提分,为大模型发展提供新方向。

机器之心
开源动态7

只要强化学习1/10成本!翁荔的Thinking Machines盯上了Qwen的黑科技

新智元报道,翁荔的Thinking Machines研究同策略蒸馏策略,能以1/10强化学习成本,结合同策略训练优势与密集奖励信号。该策略受DAGGER启发,扩展Qwen3团队工作,可在Tinker复现,还能用于个性化和持续学习。

新智元
推荐文章8

模型之上,才是真正的资产

微软CEO萨蒂亚·纳德拉在《没有生态的前沿,立不住》中提出,每家公司未来要构建人力资本与Token资本。强调Token资本构建靠学习闭环,还提出检验公司是否拥有Token资本的方法,呼吁避免价值集中到少数模型公司。

五源资本 5Y Capital
开源动态7

强迫模型自我争论,递归思考版CoT热度飙升!网友:这不就是大数推理模型的套路吗?

近日,概念CoRT火了,它在CoT基础上加了“递归思考”,能让AI递归思考响应、生成替代方案并选最优,结合“结构化自我批判”提升推理力。不过网友质疑它是“新瓶装旧酒”。

机器之心
开源动态8

黄仁勋率先开源量子AI大模型

英伟达推出全球首个开源量子AI模型家族NVIDIA Ising,含校准和纠错模型。它简化对复杂物理系统的理解,为量子纠错和校准提供高性能工具,有望加速量子系统实用化。

量子位
开源动态8

开源模型两个月内杀死比赛

过去60天,Vercel AI Gateway调用数据显示,开源模型Token调用份额从28%涨至62%,反超闭源模型。英伟达60亿美元入局扶持,闭源虽推新降价仍失领先,开源走向大规模应用。

AI前线