三阶段训练」共找到 3283 篇相关文章

算法论文8

LeCun有了新证据!大模型思考与人类思考存在本质差别

Yann LeCun参与的研究用信息论揭示大语言模型与人类在‘理解世界’上的本质差异。研究引入新量化框架,分析主流大模型,发现AI与人类在‘理解’上有大核心差异,对当前AI发展趋势提出挑战。

AI工程化
新闻资讯7

一文读懂:国产AI芯片与英伟达的差距有多大?

文章围绕国产AI芯片与英伟达的差距展开。从算力性能、生态壁垒、市场现状、技术瓶颈等方面分析差距,指出国产芯片虽在部分场景缩小差距,但高端训练和生态成熟度仍落后3 - 5年,突围需多领域突破。

芯师爷
新闻资讯7

如果海外EDA断供,国产EDA公司能支棱起来吗

文章分析了EDA行业及国产EDA覆盖情况。全球大家EDA公司处于垄断地位,EDA市场规模小,容纳公司有限。国产EDA公司数量多但有差距,部分工具可用但仍需打磨,国产EDA发展道路艰难但要坚持。

芯师爷
开源动态8

Agent 框架热潮褪去,大模型开发已经进入“生死局”?

蚂蚁开源发布《2025 ⼤模型开源开发⽣态全景与趋势》报告,涵盖 19 个技术领域 135 个项目,解读七大趋势。当下大模型开发生态如黑客松,项目兴衰快速,AI Search 式微、AI Coding 火热,大技术领域也有变化。

AI前线
推荐文章7

Langchain创始人最新分享:如何跨越“原型惊艳”到“生产可靠”的鸿沟

近日,LangChain创始人Harrison Chase在Interrupt大会演讲,指出AI行业‘原型易,生产难’痛点。分享优秀Agent工程师四大素质、智能体开发大关键,还介绍战略预判与产品布局,致力于为智能体工程师提供全周期支持。

AI工程化
开源动态8

超长推理还能节省计算!Salesforce开源神器两连发:教大模型边想边省,显著提升数学编程准确率

Salesforce AI Research开源Elastic Reasoning和Fractured Sampling。前者将推理流程分两部分,分配token预算,使输出缩短、准确性提高;后者打碎推理链条,从维度采样,以更少tokens换更高准确率,均提升数学和编程任务准确率。

量子位
产品应用7

突袭Cursor,Windsurf抢发自研大模型!性能比肩Claude 3.5、但成本更低,网友好评:响应快、不废话

当地时间5月16日,Windsurf推出首个AI软件工程模型家族SWE - 1。此系列含款模型,性能比肩Claude 3.5且成本更低。开发者试用评价不错,但也指出存在幻觉问题。Windsurf旨在提升软件开发速度,后续将持续投入。

InfoQ
推荐文章7

大模型狙击黑产:挚文集团社交生态攻防实战全揭秘

挚文集团生态技术负责人李波在AICon大会分享大模型在社交生态落地实践。介绍集团生态问题,提出构建治理框架,还阐述多模态大模型研发方案、细粒度用户画像建设及审核侧应用,最后总结现状并展望未来。

InfoQ
新闻资讯7

大模型下半场,阶跃凭什么领跑多模态之战

国内大模型竞争分资源派、技术派、国家队阵营,多模态成竞争分水岭。阶跃星辰成立两年发22款自研基座模型,16款为多模态。其坚持理解生成一体化路线,在多模态领域有优势,还布局多应用场景。

AI科技评论
算法论文8

ICML 2025 | 清华、上海AI Lab等提出傅里叶位置编码,多项任务远超RoPE

长文本能力对语言模型重要,但现有模型训练窗长有限,流行的RoPE也有局限。清华、上海AI Lab团队用傅里叶分析解读其不足,提出傅里叶位置编码FoPE,提升长文本泛化能力,实验表现超RoPE。

机器之心