「小模型性能」共找到 8837 篇相关文章
英伟达员工晒年终奖,黄仁勋霸气签皮衣;Moltbook爆火:当AI有了自己的社交网络;又一“95后”清华天才科学家庞天宇加盟腾讯混元 | Q资讯
本文汇总 AI 行业热点,有 Moltbook 成 AI 社交平台且爆火;OpenAI 两款产品用户流失;亚马逊、Meta 裁员;英伟达年终奖、合作协议情况;阿里发布千问新模型;还有大厂春节发红包竞争,DeepSeek 布局新领域等消息。
告别微调时代:拖拽式LLMs实现12000倍加速适配,输入描述,秒级定制LLM,效果、速度全面超越
传统高效微调技术成大规模部署瓶颈,论文提出Drag-and-Drop LLMs (DnD),仅需输入目标任务未标注提示,即可秒级生成适配的LoRA权重,实现LLM秒级免训练适配,效率、性能和泛化性上均有突破。
开启RL Scaling新纪元,siiRL开源:完全分布式强化学习框架,支持超千卡规模高效训练
传统强化学习框架在模型和集群规模达上千块GPU时,存在扩展性瓶颈和效率低下问题。上海创智学院团队推出siiRL,采用全分布式架构和多控制器范式,解决传统框架痛点,在多方面验证了其高性能。
OpenVision 2:大道至简的生成式预训练视觉编码器
多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。
GitHub Trending 榜一的开源 Cowork 来了!4天4.5K星,首个多智能体工作流应用!
开源项目Eigent冲上GitHub Trending榜首,4天获4.5K+ Star。它是全球首个多智能体工作流桌面应用,完全开源、支持本地模型,有多种智能体工作流,具备本地优先、并行工作流等特性,提供三种使用模式。
Gemini 3 Pro加持!这款开源神器 Clipsketch AI,帮你自动抓帧、画图、写爆文!
自媒体内卷,‘视频转图文’是流量入口,简单截图难满足需求。clipsketch - ai 开源项目用 Gemini 3 Pro 和 Nano Banana Pro 模型,实现视频理解、AI 绘画和写作自动化,解决创作者素材整理、版权等痛点。
突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题
AI后训练依赖监督微调或程序化检查器,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。
用短视频成本生成长视频,字节Seed新注意力机制让计算量降低85%
字节Seed与斯坦福等机构推出新模型,其新注意力机制MoC能让长视频生成计算量降低85%,质量不减且保持连贯性。团队将视频生成定义为上下文检索任务,提出MoC机制并阐述实现方法。
腾讯发布超低成本AI训练法!120元效果秒杀70000元微调方案
腾讯提出无训练组相对策略优化Training-Free GRPO,无需调整参数,在提示词中学习经验就能提升模型性能。实验显示,该方法在数学推理和网页搜索任务上效果显著,成本远低于传统方法。
4天拿下13.6k星!Browser Use接上Jev,Agent操作浏览器效率提升10倍
本文介绍上线4天收获13.6k星的开源项目jev-ultrafast,该项目结合Jev快速决策模型优化AI Agent操作浏览器流程,效率提升10倍,解决原有AI操作浏览器卡顿缓慢的痛点。