测试时微调」共找到 2499 篇相关文章

新闻资讯7

GPT-5系列咋都爱说「哥布林」?原因找到了

OpenAI发布博客解释模型迷上「哥布林」的原因。原来是训练“Nerdy”人格,奖励信号偏爱怪物词汇,强化学习将风格固化并扩散到普通对话。此前DeepSeek V3.1也出现过「极」字Bug。

机器之心
推荐文章7

Patreon 年度回顾中的架构经验

2025年Patreon工程团队在为超千万付费会员推新功能重建底层设施。其年度回顾详述12个项目,提炼韧性迁移、数据模型重构、分布式系统一致性权衡三大架构主题,还分享多项目实操经验。

InfoQ
算法论文7

ICML'25 | 告别手动SFT!一句话得到你的专属大模型LoRA

传统微调方法开销大、部署难,Text-to-LoRA (T2L) 框架应运而生。它基于自然语言指令对 Transformer 模型即适配,有三种架构变体,采用两种训练方法,实验显示其在多维度表现有效。

PaperAgent
产品应用7

为什么又是杭州?杭州初创团队打造全球第一个AI旅行伙伴

杭州初创团队打造的iMeanAI Coyage是全球首个AI旅行伙伴,能解决旅行规划中选择困难和信息过载问题,如订机票、酒店、行程,经测试表现出色,还将开放多语言语音导览功能。

AI工程化
算法论文7

BLIP3-o统一图像生成与理解,多模态融合趋势显现

BLIP3 - o致力于统一图像理解和生成、提升生成质量和效率。它融合自回归与扩散模型,采用CLIP + Flow Matching架构等技术亮点。经训练,在图像理解和生成任务表现出色,指令微调效果显著。

CourseAI
新闻资讯7

小扎开9位数薪酬新建AI团队!砸千亿收购华人初创公司,Llama 4太拉胯急坏了

Meta CEO扎克伯格对Llama 4表现失望,一边开7 - 9位数薪酬从谷歌、OpenAI等公司挖人组建新AI实验室,另一边豪掷148亿美元收购初创公司Scale AI 49%股份并挖来CEO,Llama 4在第三方测试中表现不佳。

量子位
算法论文8

只要9美元!LoRA+强化学习,DeepSeek 1.5B推理性能暴涨20%

南加州大学团队基于LoRA的强化学习训练1.5B推理模型,在AIME 24测试上性能提升超20%,成本仅9美元。开源Tina模型结合三大关键技术,与SOTA模型相比竞争力强,研究者还对其有效性提出假设。

新智元
新闻资讯7

深圳半导体存储器“小巨人”冲击IPO

2025年下半年存储芯片行业迈入“超级周期”,存储芯片成AI产业战略资源。近日深交所受理创意IPO申请。该公司是“小巨人”企业,业绩近年大增,但面临原材料价格波动、存货跌价等风险。

芯师爷
开源动态7

The Batch: 907 | 小而高效模型的“制作”方法

Mistral AI发布Ministral 3系列模型权重,结合剪枝与蒸馏技术,用级联蒸馏法构建。该系列参数规模有140亿、80亿和30亿,在部分测试中表现佳,训练成本低于传统方式。

DeeplearningAI
开源动态8

开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具

Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。

量子位