「训练推理效率」共找到 4360 篇相关文章
刚刚,OpenAI前CTO Mira Murati公司Thinking Machines Lab发文,揭开了大模型不确定性的真相
OpenAI前CTO Mira Murati创立的Thinking Machines Lab推出研究博客Connectionism,首篇文章聚焦LLM推理的非确定性问题。研究发现真正原因是批次不变性缺失,提出实现批次不变内核的方案,实验效果显著。
ClockBench:一个简单的钟表测试让AI全线溃败
ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。
美团也开源了大模型,但我觉得他们的野心是通用生活Agent。
美团发布并开源560B参数的MoE模型LongCat - Flash - Chat,推理速度快。与DeepSeek V3对比,输出速度优势明显。美团多个落地或内测AI功能服务C端生活场景,目标是打造通用生活Agent。
最高提效8倍!腾讯游戏发布专业游戏AI大模型,美术师做动画不用辣么“肝”了
在Devcom开发者大会上,AI成焦点。腾讯游戏发布游戏创作AI全链路解决方案VISVISE,含动画制作等四大管线,能辅助美术完成重复工作。如MotionBlink可自动补帧,GoSkinning已在多游戏应用,提升了制作效率。
可灵 2.1 首尾帧藏师傅外挂教程:两张图→大片,附万能提示词
作者分享可灵 2.1 首尾帧模型测试与使用教程,解决图片和提示词生成难题。介绍三种拿图法,给出 AI 生成提示词方法及原则,还指出可将流程固化、特效升维,提升视频创作效率与价值。
没想到,最Open的开源新模型,来自小红书
向来低调的小红书昨日开源首个自研大模型 dots.llm1,它是中等规模的 MoE 模型,在较小激活量下性能良好。其开源力度堪称行业最大,还介绍了数据处理、训练优化等多方面技术细节。
从99行代码复刻冰雪奇缘,到引领3D AI,胡渊鸣的公司凭什么「爆火欧美」?
胡渊鸣创立的 Meshy AI 爆火欧美,其产品 Meshy 带来 3D 建模效率革命。新模型 Meshy 6 精度高、可用性强,采用“3D 原生”路线。它还理顺生产流程,获大厂青睐,未来在技术、产品形态和游戏领域均有布局。
Vibe Coding“血洗”开源,社区吵翻了:封杀菜鸡 AI 开发者?不如给维护者打钱!
多位研究人员在预印本论文中指出,氛围编码或摧毁开源生态,使官网访问量下滑、社区论坛使用量骤减。研究称要维持开源规模需改革维护者报酬方式,同时分析了其对开发效率、开源软件可持续性的影响,社区对此看法不一。
8B模型任务击败GPT-5?阶跃星辰开源Deep Think新框架,小模型解锁百万Token测试时计算
阶跃星辰推出并行协同推理框架PaCoRe,让大模型突破上下文窗口和处理速度限制。基于此框架,小模型能解锁百万级Token测试时计算。PaCoRe - 8B在数学基准测试中超越GPT - 5,还具备前沿性能、“综合”能力涌现等优势。
200行python代码实现从Bigram模型到LLM
本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。