「大厂推虾苗」共找到 5510 篇相关文章
比传统方法强7倍:Anthropic物理隔离危险知识,重塑大模型安全训练范式
Anthropic团队提出选择性梯度掩码技术(SGTM),在训练阶段将危险知识物理隔离到特定参数并剔除,实现安全性与通用能力更好平衡,抗恢复性是传统方法7倍,还能处理未标记危险数据。
“还我GPT-4o”!奥特曼强推GPT-5惹怒网友,紧急公关来了
GPT-5上线后遇冷,OpenAI直接关闭既往所有型号,让网友不满。原因是GPT-5人机感重,缺乏写作创意和情感共鸣。无奈之下,奥特曼宣布付费用户可切换回4o,同时会继续更新GPT-5。
EMNLP2025 | SFT与RL的结合,vivo AI Lab提出新的后训练方法
vivo AI Lab 算法团队提出新的大模型后训练框架 GTA,综合 SFT 和 RL 优点,解决文本分类场景中 RL 收敛慢问题。论文已被 EMNLP 2025 录用,介绍了 GTA 框架设计思路、实验结果等,未来还将探索更多场景和大模型。
AI不靠“闭门造神”,海内外一线专家共探智能新纪元,GOSIM AI Paris 2025圆满收官!
5月7日,GOSIM AI Paris 2025在法国巴黎迎来第二日议程。全球专家围绕AI技术多方面探讨,涉及模型、基础设施等主题。还分享大模型趋势,宣布新型许可证,各分论坛展示多元成果,大会圆满收官,杭州场9月待启。
NUS、牛津等联合发布音视频智能综述:系统梳理大模型时代的AVI全景图
NUS领衔近10家机构发布音视频智能综述,系统梳理大模型时代AVI发展全貌,涵盖感知、生成与交互,复盘子方向工作,构建任务蓝图,整理评测体系,总结基础技术,还探讨应用、安全及未来研究方向。
700万参数击败DeepSeek R1等,三星一人独作爆火,用递归颠覆大模型推理
今年6月Sapient Intelligence提出的HRM影响大模型推理结构,四个月后三星研究员Alexia Jolicoeur - Martineau推出TRM,700万参数模型在推理基准测试中超越参数多10000倍的模型,还介绍了TRM原理、改进及实验结果。
清华新框架让大模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍
清华等团队提出全新框架RAM,受人类阅读认知启发,将“精读+略读”混合策略引入上下文压缩,突破现有方法效率瓶颈,在多任务上表现出色,实现12倍端到端加速,为长上下文LLM部署提供新范式。
空间智能新高度:港科大谭平团队SAIL-Recon突破万帧级图像大规模3D场景重建Transformer
香港科技大学谭平教授团队与地平线团队发布3D场景表征与大规模重建新方法SAIL - Recon,突破现有模型处理能力瓶颈,可实现万帧级场景表征抽取与定位重建,在多数据集上表现优于现有方法。
对话八位具身智能大咖:模型之争、数据来源与第一性原理|甲子光年
在11月20日智源具身OpenDay上,甲子光年创始人张一甲与八位具身智能领域核心践行者对话。探讨世界模型、统一架构等问题,指出具身智能虽前景好,但面临数据、模型等困境,各方分享应对策略与决策原则。
AI 基础知识从 0.6 到 0.7—— 彻底拆解深度神经网络训练的五大核心步骤
文章以 PyTorch 手写数字识别代码为引,深入剖析深度神经网络训练的五大核心步骤,涵盖前向传播、计算损失、反向传播、更新参数和循环训练,还介绍激活函数、Dropout 等概念及正则化、优化器等技术。