「混合训练框架」共找到 3588 篇相关文章
Thinking Machines新发现:Lora不是权宜之计,哪怕秩低到 1,也能匹敌全参数微调
Thinking Machines和John Schulman新研究刷新对LoRA的认知,实验显示正确使用时它能匹敌全量微调。团队系统研究训练集与参数关系,有层选择、学习率等关键发现,还给出实用建议,但LoRA在部分场景表现待验证。
LM Studio宣布支持在Mac上跑Qwen3-Next 80B模型
LM Studio宣布支持基于MLX框架在Mac上运行阿里Qwen3-Next 80B模型。该模型虽总参数量达800亿,但每次推理仅激活30亿。第三方评测显示其4bit量化运行效果好,不过实现GGUF格式支持尚需时间。
2025 的企业 AI 市场, Data &AI 占据主流视野
数据是 AI 模型学习和训练的基础,Data & AI 基础设施可打通数据与 AI 全链路。企业应用 AI 不应只关注算法和算力,还需重视私域数据。同时介绍了不同类型企业在 Data & AI 领域的特点及合作成本等内容。
刚刚,小红书开源了首个多模态大模型dots.vlm1,性能直追SOTA!
小红书人文智能实验室(hi lab)低调开源视觉语言模型dots.vlm1。该模型基于自研视觉编码器构建,在视觉理解和推理任务上接近SOTA水平,实测表现惊艳,还介绍了其技术架构、预训练数据布局等内容。
vivo发布端侧多模态模型,只有3B可理解GUI界面,20项评测表现亮眼
vivo AI Lab发布端侧多模态模型BlueLM - 2.5 - 3B,融合文本与图文能力,支持长短思考模式切换。它在20余项评测中表现出色,参数量小,训练和推理成本低,有精巧结构、高效策略,还有高质量数据和高性能平台支撑。
今年最难的机器人Demo,“机器人含量”为0
自变量发布全新灵巧操作系统TwinDex,后训练阶段真机遥操数据为0,机器人就能完成多项精细操作。该系统设计有灵巧性、一致性和可扩展性,降低了对真机遥操数据的依赖,使高质量数据与真机遥操的强绑定松动。
12项世界第一!国产基模一战封神,11亿参数逆袭70亿大魔王
蚂蚁灵波的LingBot-Depth 2.0空间感知模型,在测试中拿下12个世界第一,解决了玻璃、细小物体等行业难题。它还与奥比中光达成合作落地商业应用。其核心预训练基模LingBot-Vision被开源,有望加速具身智能生态发展。
突发:SpaceX 或 600 亿美元收购 Cursor
SpaceX官宣与Cursor合作,打造编程和知识工作AI。Cursor授予SpaceX今年晚些时候以600亿美元收购的权利,或支付100亿合作费。Cursor增长快但无自研模型,合作可助其训练模型。此外还介绍了编程AI市场竞争情况。
aiX-apply-4B逆袭DeepSeek-V3.2!aiXcoder发布代码变更应用模型,单卡推理提效15倍
3月25日,硅心科技发布专为代码变更应用场景设计的模型aiX - apply - 4B。它平均准确率达93.8%,超越Qwen3 - 4B和DeepSeek - V3.2,算力成本仅为后者5%,推理速度提15倍。还采用创新训练方法,适配企业场景。
ICLR 2026 | 这道题是否需要用图思考?模型来告诉你!自适应思考模式切换助力通用视觉推理提升
本文来自复旦大学和阿里巴巴未来生活实验室,已中稿 ICLR 2026。目前视觉推理方法有纯文本和用图思考两种模式,各有优劣。研究者提出 Mixture-of-Visual-Thoughts 范式及 AdaVaR 框架、AdaGRPO 算法,让模型自适应选模式,实验显示其在多任务有提升。