「训练中心」共找到 2353 篇相关文章
微软 & UT Dallas 联手揭秘:从 SFT 到 RL 的进阶之路
微软与 UT Dallas 合作论文揭秘大模型做漏洞检测从 SFT 到 RL 的后训练流程,构建 C/C++ 漏洞数据集跑通全流程,总结六大‘避坑’指南,还开源整套框架、数据集和模型。
对话蚂蚁灵波首席科学家沈宇军:2万小时真机数据,用“慢功夫”做具身智能|甲子光年
蚂蚁灵波首席科学家沈宇军接受专访,称具身智能处于‘GPT - 1时刻’。团队选‘慢’路,积累2万小时真机数据,发布四个具身智能模型并开源。介绍模型架构、优势、问题及未来计划,还谈了开源考量等内容。
解决算力瓶颈,给多模态瘦身!Token压缩完整图谱与选型指南
给多模态大模型瘦身是解决算力瓶颈的关键。Token压缩技术可剔除视觉冗余,提升训练与推理效率。北大等团队剖析其全貌,给出完整图谱与选型指南,还揭示了未来演进路径。
AAAI 2026 Oral | SplatSSC:解耦深度引导的高斯泼溅,开启单目语义场景补全高效新范式
单目3D语义场景补全领域长期受困于密集网格表征,现有‘对象中心’范式也有瓶颈。SplatSSC框架通过深度引导策略与解耦聚合机制,实现性能与效率提升,在实验中表现优异。
多模态大模型中Attention机制暗藏「骗局」,需用一个公式修正丨上大×南开
上海大学曾丹团队研究发现,主流VLM中attention受位置偏置和padding区域异常高attention影响,直接用其进行视觉token剪枝会丢失关键信息。团队用公式对attention去偏,集成到多种剪枝方法,提升了模型性能。
GPT-5.3爆更前夜,全网都被一张图吓到!ChatGPT人格大赏
OpenAI华人研究员Joanne Jang一条推文引发ChatGPT生图玩法热潮,它能根据聊天记录生成反映‘待遇’的自画像。近期ChatGPT记忆功能优化,已向全球Pro和Plus用户推出。还有爆料称GPT - 5.3要来了。
世界最强医疗模型百川M3发布:AI医疗,奇点已至
百川智能发布并开源全球最强医疗模型Baichuan - M3,各项指标SOTA且超越人类医生平均水平。它告别机械‘背医书’,学会主动追问、排查病因,解决AI‘胡说八道’问题,准确度超GPT - 5.2 - High。
谷歌云重磅报告:AI智能体接管2026年企业核心工作流
谷歌云基于调研发布报告,揭示2026年重新定义角色、工作流和商业价值的五大关键趋势,如智能体重塑员工、数字化流水线打通企业、全时在线重塑客户体验等,还强调人才技能重塑的重要性。
AIGC超新星专栏丨玩AI的小笼包:我离开互联网大厂,用AI重新定义“内容总监”
北京AIGC视听产业创新中心对话‘玩AI的小笼包’。她曾是大厂内容负责人,后投身AIGC创作。她分享了创作转型经历、‘超创’生态及工业化生产流程,也谈及技术挑战与行业发展方向。
大模型最难的AI Infra,用Vibe Coding搞定
Andrej Karpathy 力荐的 Vibe Coding 在 AI Infra 开发中常「水土不服」,存在上下文丢失、决策偏离、质量不稳定等问题。文章提出文本驱动的 Vibe Coding 方法,并以 Agentic RL 中的资源调度系统为例验证其有效性,还介绍了相关团队和工具。