训练 - 推理不匹配」共找到 3626 篇相关文章

开源动态7

小模型也能精确计算:WorldModel-Qwen的推理时代码执行实验

开发者bigattichouse让Qwen - 0.6B小模型推理时生成并执行WASM代码获计算结果。最初尝试加标签生成Python代码效率低,后用WASM,创建三层架构。虽结果未完美,但接近,还通过Gemini审查验证。

AI工程化
开源动态8

马斯克开源新模型:能实时抓取社交平台数据,20万块H100训练

马斯克旗下xAI开源去年最佳模型Grok - 2.5,6个月内还将开源旗舰模型Grok 3。Grok - 2.5可实时抓取社交平台X数据,用超20万块H100训练,性能超GPT - 4o等,应用场景广泛。

AIGC开放社区
新闻资讯7

反转!LeCun刚转发「全球最快开源推理模型」,ETH苏黎世就直接打假

上周,MBZUAI与G42等开源号称「全球最快的开源AI推理模型」K2 - Think,引发广泛关注,图灵奖得主Yann LeCun也转发相关推文。但三天后,ETH苏黎世研究员发文指出该模型存在数据污染、评估方式不合理等问题。

新智元
算法论文8

豆包是如何炼成的?字节放出自研万卡训练系统ByteRobust论文

文章介绍字节跳动的LLM训练基础设施ByteRobust。它由控制和数据平面构成,关键目标是获高ETTR。该系统优先快速隔离故障、考量人为错误、控制恢复可变性,已部署超一年,效果显著。

机器之心
产品应用8

阶跃星辰发布新一代基模 Step 3,原生多模态推理模型,性能达到开源 SOTA

WAIC 2025期间,阶跃星辰上线新一代基础大模型Step 3,7月31日将面向全球开源。还成立“模芯生态创新联盟”,与上海国有资本投资有限公司合作。Step 3性能达开源SOTA,推理效率高,适配多种芯片。

Founder Park
新闻资讯7

OpenAI推理第一人离职,7年打造了o3/o1/GPT-4/Codex

刚开年,OpenAI推理模型第一人Jerry Tworek离职,他在OpenAI近七年,是构建o3、o1、GPT - 4等的关键人物。他称离职是去探索在OpenAI难以开展的研究,网友有感谢赞叹也有因人才流失而沮丧。

量子位
算法论文8

无需训练的3D生成加速新思路:西湖大学提出Fast3Dcache

在AIGC浪潮中,3D生成模型虽进化快,但‘慢’和计算量大制约其应用。西湖大学AGI实验室提出无需训练、即插即用的Fast3Dcache框架,能在加速同时保持或提升模型几何质量。

量子位
开源动态8

英伟达全新开源模型:三倍吞吐、单卡可跑,还拿下推理SOTA

英伟达推出专为复杂推理和agnet任务打造的开源模型Llama Nemotron Super v1.5,实现SOTA表现,吞吐量提至前代3倍,可单卡高效运行。它采用NAS优化架构,经多数据集训练,现已开源。

量子位
开源动态8

开源即屠榜!UniME多模态框架登顶MMEB全球训练榜,刷新多项SOTA纪录

格灵深瞳等团队联合发布通用多模态嵌入新框架UniME,刷新MMEB训练榜纪录。它是两阶段框架,经文本判别知识蒸馏和困难负样本增强指令微调,在多任务达SOTA,项目已开源。

量子位
算法论文8

LeCun力荐的JEPA杀入LLM,用CV的思路训练LLM,性能鲁棒性双丰收

LeCun团队提出LLM - JEPA,将JEPA自监督学习架构从视觉扩展到LLM。它能提升性能和鲁棒性,在多模型和数据集验证有效,但有训练开销大、泛化性不足等局限。

机器之心