小模型训练」共找到 8495 篇相关文章

新闻资讯8

具身智能一步踏入Scaling Law!10B+基础模型,27万时真实数据

AI机器人创业公司Generalist推出新型具身基础模型GEN-0,参数量10B+,专为多模态训练构建。该模型展现强大Scaling Law,能力可扩展,有和谐推理等特性,在多方面有突破,成果备受赞誉。

机器之心
新闻资讯7

新“SOTA”推理模型避战Qwen和R1?欧版OpenAI被喷麻了

“欧洲的OpenAI”Mistral AI发布首款推理模型Magistral,却再遭质疑未与最新版Qwen和DeepSeek R1对比。该模型亮点是支持多语言推理,以纯RL方式训练,为LLM强化学习提供新范式。

量子位
产品应用8

开发者狂喜:Thinking Machines发布首款产品Tinker,后训练麻烦全给包了

OpenAI前CTO创办的Thinking Machines推出首款产品Tinker,这是用于微调语言模型的API,能简化LLM后训练过程,支持前沿模型,使用LoRA技术降低成本,还发布开源库,多高校团队已试用。

机器之心
开源动态8

谢赛宁等推出统一多模态模型!替代VAE实现图像理解/生成双SOTA,代码权重数据集全开源

谢赛宁等团队推出统一多模态模型Blip3 - o,用扩散Transformer生成CLIP图像特征,采用顺序预训练策略。对比多种设计方案,确定CLIP + Flow Matching最佳,模型在多任务测试表现卓越且全开源。

量子位
开源动态8

全流程国产GPU,上下文提速100倍!中国科学院发布「线性复杂度」类脑大模型

中国科学院自动化所李国齐、徐波团队发布国产自主可控类脑脉冲大模型SpikingBrain-1.0,训练推理全用国产GPU。它具线性复杂度,超长序列处理速度快,还开源7B模型,为类脑智能发展提供新思路。

新智元
开源动态7

1万4颗星!机械臂可以接大模型了!面向真实世界机器人的尖端人工智能LeRobot

LeRobot 为 PyTorch 中真实世界机器人提供模型、数据集和工具,降低入门门槛。包含尖端方法,已提供预训练模型等,未来将增加真实机器人支持,文中还介绍其安装、使用等内容。

GitHubStore
算法论文8

哈佛发现基础模型比你想象中更强大:纯采样方法可超越RL

论文提出基础模型本身已具备强大推理能力,通过“幂采样”纯采样算法,在多推理任务上媲美或超越RL后训练,挑战“RL才能提升推理”观念,为理解基础模型潜力开新视角。

深度学习自然语言处理
产品应用8

快手发布Keye-VL-1.5,同量级SoTA,让模型真正看懂视频!

近年来,多模态大语言模型兴起,但视频理解仍是难题。快手Keye团队推出Keye-VL-1.5,通过Slow-Fast编码策略、渐进式四阶段预训练和全面后训练流程等创新,实现视频理解突破,综合性能领先。

深度学习自然语言处理
新闻资讯8

Jeff Dean最新访谈:基础模型越来越强,团队如何与谷歌等巨头竞争?

Jeff Dean 在 Y Combinator 活动中与 Diana Hu 对谈,探讨 AI 创业者面临的问题。他指出推理成新瓶颈,预计有更多推理硬件;Agent 执行复杂任务进步快;团队可找 1%成功率问题;还提及稀缺能力及创业建议。

DeepTech深科技
开源动态8

社区供稿丨AgentCPM-Explore开源,4B 参数突破端侧智能体模型性能壁垒

清华大学、中国人民大学等联合研发的 AgentCPM-Explore 智能体模型开源,它基于 4B 参数,在深度探索类任务表现佳。有打破参数壁垒等亮点,还开源配套工具,提供应对模型挑战方法,邀伙伴共建生态。

Hugging Face