「LoRA训练方法」共找到 3289 篇相关文章
航空发动机用上大模型:解决复杂时序问题,性能超越ChatGPT-4o实现SOTA|上交创智复旦
上海交通大学李元祥教授等团队提出ITFormer架构,构建EngineMT-QA数据集。ITFormer能融合时序数据与大语言模型,适配多种编码器和模型,在EngineMT-QA预训练后达SOTA水平,实现高效数据分析。
The Batch:826 | 提高输出准确性的记忆层
通常提高大语言模型事实准确性需更大模型规模,会增加计算成本。Meta研究人员在transformer架构加可训练记忆层,可高效存储提取信息,提升计算效率,测试显示其能提升模型输出质量。
字节跳动发布SeedFold,蛋白质结构预测相关多任务超越谷歌AlphaFold 3,揭示大模型缩放新秘诀
字节跳动Seed团队推出新一代折叠模型SeedFold,在多个蛋白质相关任务性能上超越谷歌AlphaFold 3。该研究为有效缩放生物分子基础模型提供新思路,推出加宽模型、线性三角注意力等方法。
拒绝「盲修」:JarvisEvo 如何让 Agent 像人类一样拥有「视觉反思」能力?
现有 Image Editing Agent 缺乏视觉反馈,易致「指令幻觉」和 Reward Hacking。JarvisEvo 应运而生,它通过 iMCoT、SEPO、On - Policy Reflection 等技术,结合 ArtEdit 数据集和三阶段训练,在修图上表现出色,意义超图像编辑。
效果非常不错!阿里昨开源图形海报生成模型Qwen-Image
阿里昨日开源多模态图像基础模型Qwen-Image,基于20B参数MMDiT架构,在复杂文本渲染和精确图像编辑方面有重大突破,支持多风格图像生成、智能图像编辑等,还介绍了使用、部署等方法。
首个全面梳理语音大模型发展脉络的权威综述,入选ACL 2025主会
香港中文大学团队语音语言模型综述论文《Recent Advances in Speech Language Models: A Survey》被 ACL 2025 主会议接收,这是该领域首个全面系统综述,指明语音 AI 未来方向,还剖析技术架构、训练策略等。
一个md文件收获超400 star,这份综述分四大范式全面解析了3D场景生成
南洋理工大学研究者发表《3D Scene Generation: A Survey》综述,系统归纳300+篇论文,将3D场景生成方法分四大范式解析,还总结应用,探讨挑战与未来方向,如保真度提升、引入物理约束等。
Qwen突破:用「并行计算」代替「堆参数」,新方法内存降22倍、延迟降6倍
LLM进化依赖「堆参数」,存在训练成本高、推理慢等问题。论文提出ParScale,用「并行计算」代替「堆参数」,让模型「分头思考」,推理效率提升22倍,旧模型也能改造,落地价值大。
刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代
OpenAI正式发布GPT - 6 Astra和GPT - 6 Astra Pro,宣布AGI时代开幕。该模型训练规模大,能力升级显著,价格公布。基准测试成绩优异,在多方面表现突出,还展示诸多实际应用案例,已有企业开始测试。
DeepSeek多模态新范式:一张图压缩7056倍,思考能力反超GPT和Claude
DeepSeek上线多模态并开源新范式技术。该研究让AI用视觉原语思考,弥合语言与视觉指代鸿沟。它构建紧凑模型架构,信息压缩率达7056倍,训练分三阶段,测试中表现出色,也存在局限。