「AI模型训练」共找到 13880 篇相关文章

算法论文8

微软:DeepSeek-R1等推理模型循环的原因找到了

前几天,DeepSeek - R1论文更新,披露诸多细节。重点是推理模型在低温/贪心解码下易循环,根源是学得不对,如风险规避式复读、时序相关错误复读,还给出解决方案。

PaperAgent
推荐文章7

我用7个主流AI工具助手总结4篇写GEO公众号文章的分析及看法

作者白杨SEO参加国平老师线下分享活动,获AI相关启发。还用7个主流AI工具助手总结4篇GEO公众号文章,给出各篇核心观点,并分享自己看法,指出GEO尚无标准方法,企业应按需选择。

白杨SEO优化教程
开源动态7

Qwen3小升级即SOTA,开源大模型王座快变中国内部赛了

开源大模型进入中国时间,Kimi K2风头正盛时,Qwen3迎来升级,235B总参数量仅为Kimi K2四分之一,基准测试性能却超它。Qwen官方不再用混合思维模式,新模型仅支持非思考模式,此次是小更新,大招在后头。

量子位
算法论文8

让机器人在“想象”中学习世界的模型来了!PI联创课题组&清华陈建宇团队联合出品

斯坦福Chelsea Finn课题组与清华陈建宇团队联合提出可控生成世界模型Ctrl - World,可让机器人在“想象空间”预演任务。该模型使用零真机数据,提升下游任务指令跟随成功率。其相关论文已发布于arXiv平台。

量子位
新闻资讯7

训练机器人方式对了吗?英伟达DreamZero双榜第一新反思

NVIDIA的DreamZero在RoboArena和MolmoSpaces基准测试双登顶。分析文章《Why is DreamZero so good at robotics?》从多维度拆解其表现突出原因,质疑传统认知,如数据量并非万能,模型规模和信息输入方式也很关键。

机器之心
产品应用8

巧妙!一个传统技术让国产视觉基础模型直接上大分

格灵深瞳的Glint - MVT视觉基础模型表现出色,线性探测准确率高于CLIP等,下游任务效果佳。其引入间隔Softmax损失函数,结合虚拟类别构造等优化方案提升性能,团队专注视觉研发,务实开放。

量子位
算法论文8

别再用单选评测骗自己了!Amazon新论文揭示了大模型在多选题中的3种系统性偏差

Amazon新论文揭示大模型做多选题有3种系统性偏差,如选择、数量、猜测偏差。还推出SATA - Bench评测,给出10个测量指标,提出Choice Funnel解码策略,能提升小模型多选题正确率。

深度学习自然语言处理
新闻资讯7

Anthropic 发布最新劳动市场影响报告:AI 已拿下 75% 的程序员工作、且能做的还有很多

Anthropic发布报告,用Claude真实使用数据度量AI对劳动市场的影响。提出‘观测暴露度’指标,显示AI远未达理论上限,高暴露职业集中在白领,目前失业率未升,但年轻人入职放缓。

AGI Hunt
新闻资讯7

5个月估值120亿!OpenAI前CTO自曝首个多模态AI,竟要免费开源

OpenAI前CTO Mira Murati创立的Thinking Machines Lab获20亿美元融资,估值达120亿美元。未来几个月将发布首个多模态AI产品,还会开源部分组件,团队全力构建多模态AI以增强人类能力。

新智元
开源动态7

Lovart的开源平替产品,完全本地免费的AI设计Agent。

Lovart是热门AI设计Agent但使用成本高,现找到开源平替项目Jaaz。它接OpenAI绘图API,支持Comfyui等本地工具,能免费本地使用,功能丰富,还将推视频生成功能。

开源AI项目落地