「低成本训练」共找到 3853 篇相关文章
这大概是我读过关于AI大模型最全面、好读又易懂的文章了
文章从神经网络入手,介绍其概念、学习过程,进而引出大语言模型,阐述其原理、训练方法,还提及AI浪潮下基础设施及大模型使用方式,如Agent、MCP等,展现神经网络和大模型发展现状与前景。
DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案
DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。
刚刚,DeepSeek扔出大杀器,梁文锋署名!暴力优化AI架构
2026新年第一天,DeepSeek发表梁文锋署名新论文,提出「mHC(流形约束超连接)」架构。它仅增约6.7%训练时间开销,就能让27B参数模型性能显著提升,还可能淘汰ResNet结构。
NeurIPS 2025 Best Paper | 扩散模型不为人知的“时间差”:为什么先学会创作,后学会抄袭?
深度学习中,扩散模型能生成新图像且抗过拟合。巴黎高师和博科尼大学研究团队论文指出,这源于隐含的动力学正则化,训练分两阶段,数据量增加会拉开‘泛化窗口’,还给出数学解释。
祝贺小马智行港交所上市!|5Y News
11月6日,小马智行在港交所主板挂牌上市,成2025年全球自动驾驶最大IPO。此前已在美上市,构建“美股+港股”架构。创始人称站在商业化前夜,其核心业务多元,成本下降,还拓展全球版图。
ICCV 2025 | FDAM:告别模糊视界,源自电路理论的即插即用方法让视觉Transformer重获高清细节
针对视觉 Transformer(ViT)‘低通滤波’特性致细节丢失问题,北京理工大学等团队提出即插即用的 FDAM 模块。它受电路理论启发,能提升模型在分割、检测等任务性能,取得 SOTA 效果,有巨大应用潜力。
AI Agents,年中总结!
文章梳理6月旧金山AI Engineering World's Fair重磅分享,指出AI Agent发展方向是成为自主处理复杂工作的助手,还介绍了Ambient Agents崛起、Agent UX设计两派观点、训练进入RL时代等关键趋势。
AI最尴尬的短板,中国科学院出手了
7月24日,中科院计算所“知境”团队发布知境社会心智大模型技术体系,为现有大模型补社会心智短板。其建评测体系SoMBench,设计训练系统Zing,用部署架构Actio,在多评测超越GPT - 5.5等,应用前景广。
腾讯版Claude Design来了:多人实时同屏审设计稿,一键转代码直通IDE
腾讯公测AI设计智能体平台Ardot,有一句话生成可编辑UI设计稿、Figma文件零成本导入、一键转代码直通IDE、多人在线评审等功能。它能提升前期出稿效率,支持局部精准微调,适配主流IDE。
有人把巴菲特芒格炼化成Agent,然后开源了…
AI Hedge Fund项目将12位世界级投资大佬“炼化”成Agent,可实时分析股票、完善交易策略,还内置回测模块。它兼容13种大模型,部署门槛低,开源后获高星。不过多数框架未实盘,投资有风险。