训练机制」共找到 2825 篇相关文章

产品应用7

Unsloth让大模型跑在手机上!

Unsloth放出教程,可将其微调模型部署到Pixel 8和iPhone 15 Pro。用ExecuTorch技术优化,Qwen2 - 0.5B在旗舰机上表现流畅。教程介绍量化感知训练控制精度损失,还给出iOS和Android部署步骤及注意事项。

AI工程化
开源动态8

NVIDIA重磅开源!OmniVinci 仅 9B 模型就拿下多模态冠军!

英伟达推出全模态大语言模型 OmniVinci,架构有三大创新。OmniVinci - 9B 模型表现亮眼,多测试中大幅超 Qwen2.5 - Omni,且训练量仅为其六分之一。其架构经多阶段流程实现全模态理解,还支持多种功能。

带你学AI
开源动态8

Yann LeCun放出憋了20年的大招:Meta开源V-JEPA 2世界模型

Meta发布V-JEPA 2世界模型,参数高达10亿,推理速度比英伟达Cosmos快30倍。它基于Vision Transformer架构,是Yann LeCun倡导多年的JEPA路线成果,仅需62小时机器人数据训练就能执行任务,打脸质疑者。

AGI Hunt
产品应用8

1000+页PDF解析速度暴涨3倍,MinerU模式不香了

百度PaddleOCR推出HPD - Parsing小模型,文档解析速度大幅提升,是上一代最快模型的1.62倍、自身原解码方式的3.06倍。它采用层级并行解码架构,有两层并行设计,效果出色且兼容性好,还分享了优质训练方法和优化思路。

CourseAI
推荐文章7

对话蚂蚁吴伟:训推一体池化调度,如何把GPU用到极限

AICon大会前,与蚂蚁集团吴伟深度对话,探讨GPU资源调度解法。他指出CPU和GPU有结构性差异,只在推理或训练内优化有资源闲置,国产卡缺全链路生态,软件优化有天花板。还分享架构思路、算法及落地效果等。

InfoQ
开源动态7

一年后,DeepSeek-R1的每token成本降到了原来的1/32

几天前,DeepSeek更新R1论文至86页,公开训练全路径等细节。英伟达发表博客展示在Blackwell GPU上对其降本增效,通过软硬协同提升每瓦特Token吞吐量,还介绍了TensorRT - LLM软件及相关技术提升性能的情况。

机器之心
新闻资讯7

Fable 5解禁即翻车!写一行代码就降智,开发者破防

消失19天的Fable 5解禁即翻车,因过度审查和双标机制,让开发者破防。但抛开护栏,它执行复杂任务能力强。A社同期发布的Sonnet 5也遭群嘲,此外,A社还提出评估框架并向政府让步。

新智元
产品应用8

捅破具身智能天花板!极佳视界新VLA大模型登场,复杂长时程任务近100%成功率

极佳视界推出GigaBrain-0.5M*VLA大模型,以世界模型条件驱动,引入人在回路持续学习机制。在与主流方法对比中,任务成功率提升30%,长时程任务近100%成功,还具备高效准确的价值预测能力。

量子位
产品应用7

Codex 的野心,MCP 和 Skill 的下一步

作者密集使用Codex App等Agent应用,发现顶尖Agent收敛到相同界面布局。Codex野心大,要处理多格式文件、支持专业工作流。MCP和Skill未解决用户二次编辑问题,插件机制或是出路,Codex已有原始插件市场。

宝玉AI
新闻资讯8

人形机器人交付元年,行业从卷模型转向拼数据

2026年是具身智能交付元年,行业从卷模型转向拼数据。全球权威机构重新定义“人形机器人数据”地位,真机数据是模型落地关键。乐聚等企业积极布局,通过训练场模式获取数据,解决行业痛点。

DeepTech深科技