小模型训练」共找到 8590 篇相关文章

新闻资讯8

AI不是比人聪明,是输得起!菲尔兹奖得主点破OpenAI十项成果

OpenAI发布内部版模型Astra的十项成果,引发数学界震动。菲尔兹奖得主Timothy Gowers分析其成果,指出AI优势在‘输得起’,还探讨找例方法、模型短板,给出训练建议与衡量跨越门槛的标准。

新智元
新闻资讯7

万字对谈 Physical Intelligence(π):具身智能的卡点和下一步突破,到底在哪?

本文是对Physical Intelligence联创兼CEO和核心研究科学家的访谈。他们探讨具身智能现状,指出当前瓶颈是智能软件,还谈到VLM性能、数据收集、模型训练等问题,认为通用机器人基础模型被低估。

Founder Park
开源动态8

Agent RL和智能体自我进化的关键一步: TaskCraft实现复杂智能体任务的自动生成

当前智能体训练缺高质量任务数据,主流数据集依赖人工标注,规模和复杂性受限。OPPO 研究院提出 TaskCraft 框架,能自动生成智能体任务,构建并开源含约 41,000 条任务的数据集,支撑智能体训练评估。

机器之心
算法论文8

通用LLM压缩算法,居然藏视频编码里!2.5bit实现4bit性能,硬件无缝支持

LLM.265研究发现,视频编码器是高效的大模型张量编码器,现成视频编解码硬件压缩AI模型数据效率高。它灵活控制码率、可压缩多种张量,还能利用GPU硬件加速。实验显示其压缩效果显著。

新智元
算法论文8

视频生成太慢?英伟达、谢赛宁等发布TMD框架,实现70倍加速

大规模视频扩散模型采样效率低,应用受限。英伟达联合谢赛宁等提出TMD框架,将大型视频扩散模型蒸馏为少步生成器。实验显示,TMD能实现超70倍加速,质量损失,用户也更偏好其生成的视频。

机器之心
推荐文章7

入局AI Infra:程序员必须了解的AI系统设计与挑战知识

文章分享传统后台工程师技术栈和方法论如何迁移到AI系统,系统性拆解AI Infra的硬件、软件、训练和推理挑战,如硬件从CPU到GPU、软件依赖深度学习框架,还分析训练和推理面临的问题及解决办法。

腾讯技术工程
推荐文章8

重磅!翁荔最新Scaling Law深度洞察来了

北大毕业的前OpenAI高管翁荔(Lilian Weng)的《Scaling Laws, Carefully》值得一读。Scaling law是预训练预算表,能帮少烧错钱。文章探讨大模型训练预算分配,分析Kaplan和Chinchilla结论差异及数据稀缺问题。

PaperAgent
产品应用8

刚刚,智谱砍掉OpenClaw最大门槛!1分钟装好,一键塞进飞书

OpenClaw爆火但安装门槛高,催生天价代装生意。智谱发布AutoClaw(澳龙),将其打包为一键安装桌面应用,白1分钟上手。内置Pony - Alpha - 2模型,支持模型热插拔与飞书集成,50 + 技能开箱即用。

新智元
算法论文9

AI开始改进“改进自己的方法”,RSI进入平方时代丨MetaRSI

本文介绍CosmosMind联合十余家海内外高校,发布全球首个统一三类RSI的元递归架构MetaRSI-v1,实现AI改进自我改进过程,在大模型均获显著性能提升,提出统一范式与五大定律并开源项目。

量子位
推荐文章7

转译:AI 为啥这么爱用破折号?

文章探讨AI爱用破折号的原因,指出让模型不用破折号很难。分析了几种解释,如从训练数据学来、因“万金油”特性、受RLHF工作者方言影响等,认为训练数据混入大量纸质扫描书是最可能的原因。

宝玉AI