大模型预训练」共找到 9539 篇相关文章

开源动态8

刚刚,OpenAI开源2个推理模型:笔记本/手机就能跑,性能接近o4-mini

OpenAI深夜开源gpt-oss-120b和gpt-oss-20b推理模型,距上次开源已6年。模型亮点多,性能强,在多方面表现超专有模型。官方还放实测视频,展示其使用效果,同时解释了开源原因。

量子位
产品应用8

壁垒在上下文,不在模型

特赞科技发布企业级智能体系统 GEA,推出发散推理模型和企业上下文系统。指出模型能力易复制,企业上下文才是壁垒。GEA 架构分四层,有独特的推理和执行模式,已在多家企业部署。

AGI Hunt
新闻资讯7

【独家】对话汤元科技任冬淳:物理AI的瓶颈,在于训练体系|甲子光年

对话汤元科技任冬淳,探讨物理AI瓶颈。他认为物理AI瓶颈在训练体系,要满足数据结构质量、训练验证闭环、数据规模效率三要求。汤元构建训练底座,为具身智能和智驾提供服务,具身智能是未来重心。

甲子光年
新闻资讯7

当国产模型追上闭源旗舰,企业 AI 编程的真正障碍才浮出水面

过去企业AI Coding讨论多集中在模型能力等方面,DeepSeek V4出现缓解了模型问题,但更深层的代码库业务隐知识等问题浮现。合规限制使企业工具建设受阻,V4打破了模型供应瓶颈,可组织知识管理仍成难题。

InfoQ
产品应用8

神Karpathy都投的AI实时视频生成模型:直播都能立即转,无限时长几乎零延迟

AI初创公司Decart推出首个零延迟无限实时视频生成的AI模型MirageLSD,神Karpathy都投资了。它能实时生成视频流,无时长限制且延迟低至40毫秒以下,还攻克了传统模型‘误差累积’难题。

量子位
开源动态8

推理速度10倍提升,蚂蚁集团开源业内首个高性能扩散语言模型推理框架dInfer

近日,蚂蚁集团开源业界首个高性能扩散语言模型推理框架 dInfer,在基准测试中,其将 dLLM 推理速度较 Fast - dLLM 提升 10 倍以上,攻克推理瓶颈,为开发者提供高效框架,推动扩散语言模型走向成熟。

机器之心
新闻资讯8

SIGGRAPH 2025奖项出炉:上科、厦入选最佳论文

本周三,全球图形学顶级会议 SIGGRAPH 公开今年论文奖项。该会议影响力高,涵盖动画、生成式人工智能等多领域。今年有上科、厦等校论文入选最佳,还有时间检验奖等,涉及动力学框架等研究。

机器之心
产品应用8

实测!DeepSeek V4-pro是第一个接近Claude开源模型,前Meta研究员震惊

DAIR.AI创始人、前Meta AI研究员Elvis用DeepSeek - V4 - Pro在Pi框架搭LLM知识库,该模型开箱即用,完成知识密集型多步研究任务表现出色,在开源模型里Agent编程和推理能力强,架构设计让推理快且成本低。

AI寒武纪
推荐文章7

LLM遇上表格:4类表示、5任务、3机会

文章指出LLM处理表格有任务单一、输入复杂易崩、表示不统一痛点,介绍4种表格输入表示法、5任务,还发现任务复杂度、输入复杂度及表示统一方面存在新研究机会。

PaperAgent
算法论文8

模型一统?1100多个模型殊途同归,指向一个「通用子空间」!

约翰斯・霍普金斯学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间。此研究为神经网络参数空间“通用性”提供严谨实证,虽成因待探索,但意义深远。

AINLPer