「新推理模型」共找到 9634 篇相关文章
被 AI 大厂逼至绝望,这帮欧洲人发起了一场“科学复兴运动”
AI前沿成果被科技巨头锁在“黑箱”,欧洲科学家、工程师等发起“科学复兴运动”成立LAION。他们构建开放数据集,训练出表现优异的模型,还进行“爱丽丝梦游仙境”研究测试大模型,探讨推理模型发展方向。
DeepSeek-R1全升级V2版:Token成本低至原来30%
DeepSeek - R1 V2版全维度升级,训练框架从‘单一RL’到‘多阶段协同优化’,推理能力从‘能推理’到‘会优化推理’,还提升了安全可控性,适配生态,推出轻量级模型。
再也不怕面瘫脸!YouTube黑科技:AI帮你「永久微笑」,连僵尸都咧嘴笑
YouTube在Shorts相机里实现AI实时「重绘」人脸,效果自然。它通过知识蒸馏将大模型「瘦身」成小模型,用迭代蒸馏打磨细节,PTI保证身份特征,MediaPipe搭建推理管道,还将拓展视频生成功能。
新手入门 | 搭建 AI 模型开发环境
文章为新手提供AI模型开发环境搭建方法,涵盖安装显卡驱动、CUDA、cuDNN、Miniconda、PyTorch、Transformers等,还介绍用Modelscope下载加载模型、PyCharm配置及解决常见问题。
阿里“闪电战”再发力,这次是千问APP
阿里在AI领域影响力大,Qwen3-Max模型能力强,开源模型Qwen3-235B在Lmarena上开源第一。新发布的千问APP成Qwen模型第一入口,功能丰富免费,体验佳,是同类产品劲敌。
OpenAI 迈出关键一步:LLM 黑盒不再是盲盒
OpenAI开源新研究成果,提出全新范式,训练权重稀疏的Transformer模型以提取人类可理解的电路。该方法分三步,关键结果显示稀疏模型优势多,但也存在训练成本高、规模有限等局限,还给出两条未来路线。
10B超越Gemini-2.5-Pro!阶跃星辰端侧多模态天花板开源
阶跃星辰多模态智能团队开源STEP3-VL-10B多模态模型,仅100亿参数却性能惊人。它采用了独特的架构、训练策略与推理机制,在多任务上表现出色,为小模型发展提供新思路。
NeurIPS2025 Spotlight | RobustMerge: 多模态大模型高效微调模型合并的全新范式
中科院、中山大学、北大团队针对高效微调模型合并难题,提出「方向鲁棒性」概念,揭示 PEFT 模块合并失败主因,给出 RobustMerge 解决方案,提升性能,成果开源。
8B硬刚72B!MiniCPM-V 4.5技术报告正式出炉
行业首个具备“高刷”视频理解能力的多模态模型MiniCPM-V 4.5技术报告发布,提出三项关键技术,使模型在多任务达同级SOTA,8B参数规模超72B模型,推理快,开源后获社区好评。
Meta打开AI元认知,让AI不止会解题,还会总结套路了
Meta等机构提出‘元认知重用’机制,让大模型学会反思总结。大模型打造‘行为手册’,与主流RAG系统有本质区别。研究人员设计三种实战用法,虽有局限,但为大模型推理难题提供了解决方案。