「大厂工作」共找到 5945 篇相关文章
星海图高继扬:具身智能下半场,应用为王
星海图CEO高继扬在AGI Playground大会分享具身智能观点,认为2026年是下半场,核心是应用。具身智能发展慢因缺高质量数据和合适本体,未来产品形态或为‘整机+预训练模型+后训练工具’,下游将形成大生态。
“当年在OpenAI像在疯人院!”Jev作者完整访谈:全人类陪AI聊天的价值,不如程序员一个for循环
本文整理了前OpenAI核心研究员、Jev模型创始人Diogo Almeida的完整访谈,Diogo批判当前行业all in聊天大模型的路径偏差,推出专为程序决策设计、不做聊天交互的Jev模型,提出全新RLCD技术范式,倡导AI作为软件底层基础设施赋能自动化生产力。
Harness Engineering 为什么是 Agent 时代的“控制论”?
本文是 George Zhang 对 Harness engineering 的解读。OpenAI 提出新工作方式,让 agent 编码,引发讨论。从瓦特调速器到 Kubernetes 再到如今的 harness engineering,本质都是控制论模式。LLM 或使代码库反馈回路在关键决策层闭合,但校准传感器和执行器是难题。
万亿思考模型新速度!蚂蚁开源Ring-2.5-1T:IMO金牌水平,强;混合线性架构,快!
蚂蚁集团发布全球首个开源混合线性架构万亿参数模型Ring - 2.5 - 1T,打破深度思考牺牲推理速度和显存的‘不可能三角’。还同期发布扩散语言模型LLaDA2.1和全模态大模型Ming - flash - omni - 2.0,想做成可复用底座。
NUS LV Lab新作|FeRA:基于「频域能量」动态路由,打破扩散模型微调的静态瓶颈
在大模型时代,参数高效微调(PEFT)已成为迁移大规模扩散模型至下游任务的标准范式。但现有微调方法多采用「静态」策略,忽略扩散生成过程内在规律。新加坡国立大学LV Lab等机构提出FeRA框架,通过频域能量动态路由,实现高效微调。
AAAI 2026 Oral:明略科技开创稀疏数据「信息瓶颈动态压缩」,精度+速度双SOTA
在机器人和具身智能领域,transformer模型又大又‘重’,边缘设备难以承受。东南大学、中南大学、明略科技联合提出的CompTrack论文,创新性解决AI模型处理稀疏数据的‘双重冗余’,在3D点云跟踪任务上实现精度和速度双优。
MOE RL实战:统一FP8全流程训练
SGLang RL团队等联合完成工作,实现RL中全流程FP8训练与采样。介绍FP8训练硬件基础、格式、scale选择等,指出训练难点,分析KL Loss异常归因,验证其在MoE模型RL应用效果,还探究模型规模对训推不一致性的影响。
7.5K Star!HKUDS开源AI全栈开发框架,产品经理的Demo神器!
AI时代从论文到产品Demo开发全链路工作耗时费力,现有Agent也有诸多问题。香港大学数据科学实验室(HKUDS)开发的DeepCode开源框架,定位“全自动AI软件开发框架”,可一键从论文/需求生成完整项目,已获7.5K Star。
Qwen3 变身扩散语言模型?不从零训练也能跑,30B参数创纪录
扩散语言模型(DLM)潜力大但训练难,Radical Numerics团队改造Qwen3-30BA3B,推出30B参数的开源扩散语言模型RND1-Base。该研究系统性研究A2D转换关键因素,成果超现有部分模型,还提出简单方法及训练策略。
他们在1993年就提出了Scaling Law
原来,Scaling Law在32年前就被提出了,不是2020年的OpenAI、不是2017年的百度,而是1993年的贝尔实验室。在一篇文章里提出一种预测方法,研究人员可以预测模型在更大数据集上的表现,这和现在大家常提的Scaling Law几乎一致。