「模型训练难题」共找到 8646 篇相关文章
GLM4.5之后,智谱又开源GLM-4.5V,实测下来视觉推理能力贼强~
智谱继GLM4.5后又开源GLM - 4.5V,它是同级别开源SOTA视觉推理模型,在多模态理解榜单表现优异。文章实测其在科研全生命周期的应用,还介绍了模型架构设计和训练策略。
2.12页/秒,MinerU2.5太快了,1.2B硬刚腾讯、阿里
GPT - 4o等刷新OCR榜单,但产业界仍面临文档图像处理难题。MinerU2.5提出1.2B轻量级文档解析模型,采用创新解耦范式,在多基准测试表现出色,单卡吞吐快,还给出可借鉴创新点。
杨植麟带 Kimi 团队深夜回应:关于 K2 Thinking 爆火后的一切争议
上周,月之暗面发布并开源 Kimi K2 Thinking,主打“模型即 Agent”,引发广泛关注。今日凌晨,杨植麟等团队成员在 Reddit 开展 AMA 活动,回应 K2 Thinking 相关问题,如 KDA 机制应用、训练成本、速度与准确性平衡等。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
跨芯片统一优化,DLCompiler与DLBlas驱动算子极致表现
9月10日,上海AI实验室DeepLink团队开源DLCompiler和DLBlas。前者是扩展Triton的深度学习编译器,后者是面向大模型的高性能算子库。它们有跨架构DSL扩展等亮点,在多芯片上实现性能优化,还解决了DSA芯片优化难题。
Kimi K2技术报告正式发布:“保姆级”深度解析,一文读懂万亿参数智能体的所有秘密
Kimi K2技术报告发布,Moonshot团队用万亿+参数稀疏MoE架构等打造接近Claude - Opus的通用大模型。围绕训练稳定性等改进,有预训练、架构设计等多方面创新,为智能体领域提供可行路径。
40倍推理加速!复旦&微软:用「非线性流」拟合复杂轨迹,2步生成媲美原画
ArcFlow是复旦与微软提出的图像生成加速方案,引入非线性流拟合复杂轨迹。它在仅2步推理下保持画质,实现约40倍推理加速和4倍训练收敛加速,微调极少参数,在多模型验证效果出色。
一张俯视图,竟然能生成完整3D小镇?
获取高质量3D场景成本高、耗时长,现有3D生成模型扩展到完整场景生成时问题多。加州大学提出无需训练的3DTown框架,能从单张俯视图合成真实连贯3D场景,虽有挑战但表现优于基线方法。
机器人视觉语言导航进入R1时代!港大联合上海AI Lab提出全新具身智能框架
香港大学与上海AI Lab联合提出VLN - R1,可将自然语言指令转化为连续导航动作,打破传统链条。它有两阶段训练等创新支柱,在测试中表现出色,小模型性能佳,推动具身智能从数字向具身认知跨越。
DeepSeek揭秘o1后,小红书似乎破解了o3的技术路线,还开源了~
OpenAI闭源后,大家不知其先进模型技术路线,解密成重要任务。DeepSeek R1年初开源后引发关注,小红书团队核心贡献的论文似破解o3谜题,还开源模型等,为训练调优提供可行路线。