「AI模型训练」共找到 13843 篇相关文章
Jev火了,但真正重要的不是Jev | 5Y View
TypeSafe AI发布专用决策模型Jev后引发开发者社区关注,本文跳出Jev本身讨论,重新审视大模型通用生成的默认前提,提出AI计算专用化与任务分工的核心观点,预判AI行业发展趋势。
和一线研究员的闭门讨论:蒸馏变难后,下一步的重点是什么?
本文整理拾象邀请多家头部模型厂商一线AI研究员的线下闭门讨论,围绕大模型前沿方向分享业内共识与分歧,涵盖Computer Use、RSI、模型蒸馏、训练数据、数据生意等核心议题,干货密度高。
南大团队直击大模型高分神话:人类90分,最强模型仅49分
南京大学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距大,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。
他们让万亿参数RL学会了「省着跑」,顺便砍掉九成算力
2025年,强化学习成大模型进化主战场,但万亿参数模型跑RL成本高。Mind Lab团队实现1T参数模型LoRA高效RL训练,GPU消耗降90%,技术开源。此外还有Memory Diffusion记忆机制等成果。
Kimi新架构让马斯克叹服!17岁高中生作者一战成名
17岁高中生陈广宇作为共同一作的论文提出Attention Residuals技术,将注意力机制“旋转90度”。该技术可让模型“回头看”,经Kimi Linear 48B大模型验证,训练效率提升25%,推理延迟增加不到2%。
FDE 火了:两个追求 AGI 的公司,为什么都开始「雇人上门」了?
OpenAI 收购 Tomoro 获 150 名现场部署工程师,Anthropic 联合机构成立新公司派工程师驻场。两家顶尖 AI 公司均用几十亿美元买人,引入 FDE 概念,表明强大模型需结合现场服务释放 AI 能力。
阿里“闪电战”再发力,这次是千问APP
阿里在AI领域影响力大,Qwen3-Max模型能力强,开源模型Qwen3-235B在Lmarena上开源第一。新发布的千问APP成Qwen模型第一入口,功能丰富免费,体验佳,是同类产品劲敌。
中国AIGC「全家桶」来了!三箭齐发杀入全球第一梯队
3月27日,2026中关村论坛上,天工AI发布游戏世界模型Matrix - Game 3.0、视频大模型SkyReels V4和音乐大模型Mureka V9,杀入世界第一梯队,解决行业顽疾,还发布2026 AGI战略。
图灵巨擘RL教父齐聚,机器人秀拳脚嗨翻全场!「悟界」首发引爆物理AGI
智源大会开幕,四位图灵奖得主等出席。会上,Bengio提出‘科学家AI’应对安全风险;Sutton称AI迈入‘体验时代’;Hausman讲构建物理智能。智源还发布‘悟界’系列大模型,含Emu3、Brainμ等,迈向物理AGI。
Cursor为Blackwell从零构建MXFP8内核,MoE层提速3.5倍,端到端训练提速1.5倍
Cursor团队从NVIDIA的Hopper H100s升级到Blackwell B200s后遇性能瓶颈,他们回归基础,从零重写MoE训练层,抛弃对现有CUDA库依赖,释放了Blackwell架构潜能,实现MoE层和端到端训练提速。