「AI模型开发」共找到 13981 篇相关文章
拆解大模型几项核心操作背后的数学与 Infra 优化逻辑
文章拆解大模型核心操作(RMSNorm、Softmax、Causal Mask、Sampling)背后的数学与Infra优化逻辑。指出Infra优化是用数学等价变换或精度妥协换硬件利用率和推理速度,还介绍各操作原理、问题及优化方法。
Karpathy戳破强化学习神话,首提AI复盘式进化!暴力试错将死
AI大神Karpathy发文指出强化学习(RL)有局限,效率随任务时长下降,与人类学习机制差异大。他提出复盘式进化Scaling范式,虽有很多细节待完善,但认为还有更多S型增长曲线待发现。
谷歌预览Code Wiki:你能信任AI来记录你的代码库吗?
谷歌预览Code Wiki,为代码库生成并更新文档,预览版含数百开源项目文档,Gemini CLI扩展将支持内部代码库。它有聊天界面,但AI生成文档缺乏权威性,开发人员看法不一,且非真正维基。
Embedding黑箱成为历史!这个新框架让模型“先解释,再学Embedding”
来自多高校研究人员推出可解释的生成式Embedding框架GRACE,解决传统文本表征模型黑箱式表征瓶颈。它重新定义对比学习信号,含三个关键模块,训练双模式统一,实验跨任务提升且不损生成能力。
重磅发现!大模型的「aha moment」不是装腔作势,内部信息量暴增数倍!
中国人民大学等联合团队研究发现,大模型推理有“信息脉冲”,特定步骤互信息值飙升形成“互信息峰值”,对应“思考词汇”。基于此提出无需额外训练提升推理性能的方法,代码已开源。
ICCV 2025 | HERMES:首个统一3D场景理解与生成的世界模型
本文介绍HERMES,首个统一3D场景理解与生成的世界模型。它由华中科技大学等团队合作研发,通过共享LLM驱动两大任务,解决了输入处理和任务融合难题,实验效果显著,为自动驾驶提供新范式。
进攻是最好的防守:超级平台为何「不得不」对AI智能体出手?
上海交通大学团队提出,超级平台“必须”攻击AI智能体,以守住其作为数字流量守门人的地位。研究从守门人理论分析反击原因,还阐述平台应对策略、攻击策略特点约束,最后强调要推动建设性技术治理生态。
卡车自动驾驶里程超10亿公里,嬴彻科技定义“货运物理AI”
2026年9月3日,嬴彻科技宣布卡车自动驾驶商业运营里程破10亿公里,以超90%市场份额领跑中国卡车智驾市场。其构建“货运物理AI”,有三大核心能力,还布局全场景货运网络,海外业务也有突破。
如何让AI推荐企业官网?官网GEO优化怎么做?【必看】
白杨SEO从网站代码优化、站内内容、站外推广三方面,介绍让AI推荐企业官网及做好官网GEO优化的方法。如代码优化要主动提交网站、部署SSL证书等,还给出企业官网老板执行清单。
不增加人手,项目效率飙升45%,OpenAI公开了一套AI实战经验
OpenAI公开基于大语言模型和专属Skill包的开源仓库维护方法论,将重复工作自动化,使项目代码合并吞吐量飙升45%。该方法由AGENTS.md、Skill包和GitHub Actions构成,还涉及任务分配、验证策略等。