端到端微调」共找到 2546 篇相关文章

开源动态7

Distilabel DeepSeek-R1 模型蒸馏教程

文章介绍结合distilabel与QLoRA技术定制专属大模型的路径。先用distilabel框架利用DeepSeek - R1生成医疗指令数据集,再用QLoRA技术微调Qwen3 - 4B模型,还给出实战路线图和代码示例。

机器学习AI算法工程
产品应用8

微软深夜发布SambaY架构,Phi-4min加速10倍推理

微软基于Phi-4-mini版本,针对特定推理任务微调出Phi-4-mini-Flash-Reasoning 3B模型,将其扩展200064 tokens。采用新型SambaY架构,支持64K token上下文长度,运行快10倍,有诸多优点。

PaperAgent
新闻资讯7

The Batch: 945 | 制药巨头大举押注 AI

制药巨头 Eli Lilly 向 Insilico Medicine 提供最高 27.5 亿美元,用于药物研发。Insilico 用生成式 AI 进行药物发现,从靶点分子设计效率高,虽尚无 AI 药获批,但显示出潜力。

DeeplearningAI
新闻资讯7

Google 亲手证明:GUI 已死,但尸体还在动

Google DeepMind发布Flash - Lite Browser,能用Gemini 3.1 Flash - Lite实时生成网站。它表明GUI连预先设计都不需要,界面正发生三层分化,虽有不足,但展现界面从预制即时生成的趋势。

AGI Hunt
产品应用7

龙虾更新出了大bug,12小时内紧急发新版

龙虾火速更新OpenClaw 2026.3.23版本,距3.22版本仅12小时。此次更新光速修复UI崩溃,接入DeepSeek和Qwen家族,完善插件API兼容性,还在UI、模型、安全等方面有改进。

量子位
产品应用8

只要1分钟!电脑装满血龙虾,现在跟下载APP似的

智谱推出电脑应用AutoClaw(澳龙),从安装使用仅需1分钟,无需配置。它可切换多种模型,预置50多个Skills。能一键接入飞书,玩法多样,还降低了OpenClaw使用门槛。

量子位
算法论文8

拒绝Reward Hacking!港科联合快手可灵提出高效强化学习后训练扩散模型新范式

使用强化学习微调扩散模型时,常面临Reward Hacking和KL正则化阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则化和多样性感知优化,解决痛点且全面开源。

机器之心
新闻资讯7

又是浙大校友!AI眼镜“隔空取物”,戴上即可随心选中现实世界任意物体

混合现实重塑人机交互边界,但传统XR设备选物易出错。研究团队提出Reality Proxy,即现实物体的抽象数字表示,将交互目标转移代理上,便于用户摆脱限制选物,还支持多种交互功能。

量子位
产品应用8

传统云还在「卖铁」,下一代云已在「炼钢」:火山引擎xLLM如何一张卡榨出两张的性能!

大模型上线部署时推理成本高、算力投入大但效果不成正比,企业面临推理效率难题。火山引擎 xLLM 大语言模型推理框架性能极致,成本低,集成关键创新,还被集成 AI 云原生推理套件 ServingKit 中。

机器之心
产品应用7

OmniWork:面向创作者的 Agent OS

文章介绍了面向创作者的 Agent OS OmniWork,它的 Agent 围绕专业方向定制,Expert 和 Skill 可自行创建,能多 Agent 协作。通过实例展示其从热点捕捉生成 BP、文章创作等功能,还介绍了底层逻辑,适合创作人群。

AGI Hunt