训练技术」共找到 4600 篇相关文章

开源动态8

重磅!Meta开源通用神经输入系统!人人可用的非侵入式手环登场

Meta开源通用神经输入系统,用基于手腕的输入技术结合上下文感知AI带来新交互体验。关键技术EMG可读取大脑电信号,将其转成数字命令,系统表现优秀,为“隐形”人机交互奠基。

带你学AI
推荐文章8

OpenAI核心研究员:比提示词工程更重要的,是spec-writing

OpenAI研究员Sean Grove在AIEWF 2025演讲提出,程序员最有价值技能是向AI传达意图,完善规范是含完整意图的「源代码」。他还分享软件工程看法,涉及规范执行、模型训练等内容。

Founder Park
新闻资讯7

Windsurf交易内幕疯传:24亿美元被瓜分,背刺数百员工?

谷歌24亿美元“反向人才收购”Windsurf,交易核心是剥离人才与技术。大部分钱流向创始人、部分工程师和早期投资者,员工利益受损,新Windsurf未来严峻,与OpenAI交易因微软介入告吹。

机器之心
算法论文8

文生图Scaling新变量,被字节Seed团队发现了

ByteDance Seed团队研究发现,文生图模型中自然语言Caption变长,不意味着模型获更多视觉监督,其信息量更能预测训练损失。团队提出Structured Prompt,从两侧提升文本条件,在多任务上取得显著提升。

机器之心
新闻资讯7

The Batch: 921 | 美国战争部弃用 Anthropic,转而拥抱 OpenAI

OpenAI与美国战争部达成协议,为其提供能处理机密信息的AI系统,取代Anthropic Claude。此前Anthropic因限制技术用于军事监控和自主武器,与白宫对峙,被列为供应链风险,Anthropic将起诉政府。

DeeplearningAI
推荐文章8

这大概是我读过关于AI大模型最全面、好读又易懂的文章了

文章从神经网络入手,介绍其概念、学习过程,进而引出大语言模型,阐述其原理、训练方法,还提及AI浪潮下基础设施及大模型使用方式,如Agent、MCP等,展现神经网络和大模型发展现状与前景。

腾讯技术工程
开源动态8

2026开年王炸模型MiroThinker 1.5实测:Google和GPT没做到的事,被它做到了

自媒体从业者实测开源模型MiroThinker 1.5,它不拼参数规模,注重去伪存真。在多场景测试中表现出色,如投资决策、内容查证等。其技术揭示大模型未来或在于外部交互,而非参数膨胀。

AI寒武纪
开源动态8

DeepSeek-OCR是「长文本理解」未来方向吗?中科院新基准给出答案

DeepSeek-OCR的视觉文本压缩技术降低长文本处理成本,中科院自动化所等团队推出VTCBench基准测试评估模型视觉认知,含三大任务及衍生版本,测试结果有‘U型曲线’,还评测多种尖端模型。

新智元
8

刚刚,DeepSeek扔出大杀器,梁文锋署名!暴力优化AI架构

2026新年第一天,DeepSeek发表梁文锋署名新论文,提出「mHC(流形约束超连接)」架构。它仅增约6.7%训练时间开销,就能让27B参数模型性能显著提升,还可能淘汰ResNet结构。

力学与人工智能
算法论文8

NeurIPS 2025 Best Paper | 扩散模型不为人知的“时间差”:为什么先学会创作,后学会抄袭?

深度学习中,扩散模型能生成新图像且抗过拟合。巴黎高师和博科尼大学研究团队论文指出,这源于隐含的动力学正则化,训练分两阶段,数据量增加会拉开‘泛化窗口’,还给出数学解释。

深度学习自然语言处理