「任务级奖励」共找到 2935 篇相关文章
专治Demo玩家:「具身灵巧操作奥林匹克」大赛三项第一,全被国内这家公司拿下
星动纪元凭借自研VLA具身智能模型,在具身界灵巧操作奥林匹克Benjie's Olympics大赛中,于翻袜子(银牌难度)、开锁和剥橘子(金牌难度)三项任务上击败技术领先者PI,拿下全球第一,展现全栈技术优势。
Make SFT Great Again!从SFT到DFT:一权重之差,泛化之跃
大型语言模型的监督微调(SFT)简单高效,但泛化能力弱于强化学习(RL)。本文直击 SFT 核心缺陷,揭示其泛化瓶颈源于隐含的“病态奖励结构”,并提出仅需单行代码修改的动态微调(DFT),实验表明其效果显著。
太初元碁乔梁:AI算法已经跑到单芯片极限|MEET2026
在量子位MEET2026智能未来大会上,太初元碁乔梁表示,当下AI算力需求指数级增长,超智融合成行业共识。单颗芯片性能成瓶颈,太初元碁设计PC link实现芯片互联,还分享了HPC+AI在多领域的落地实践。
容器可观测新视角: SysOM延时监控助力定位业务抖动原因
云原生场景下,资源超卖和混合部署使宿主机与容器化应用资源竞争加剧,引发内核级延迟问题。本文结合实战案例,介绍用ack - sysom - monitor Exporter分析定位内核延迟,还介绍了SysOM监控及解决系统延时的方法。
AAAI 2026 Oral:明略科技开创稀疏数据「信息瓶颈动态压缩」,精度+速度双SOTA
在机器人和具身智能领域,transformer模型又大又‘重’,边缘设备难以承受。东南大学、中南大学、明略科技联合提出的CompTrack论文,创新性解决AI模型处理稀疏数据的‘双重冗余’,在3D点云跟踪任务上实现精度和速度双优。
智谱终于发布GLM-4.5技术报告,从预训练到后训练,细节大公开
上个月底智谱开源 GLM-4.5 及轻量版,成绩亮眼引热议。现其技术报告发布,详述预训练到后训练细节,还介绍了开源 RL 框架 slime,展示模型架构、训练阶段等,评估了在多任务上的表现。
构建会思考的测试Agent:从自动化到自主智能的演进
文章介绍面向企业级软件测试的质量数字人系统,结合大语言模型等实现从传统到自主智能测试跨越。分析专有云测试困境,指出通用AI Agent平台局限,阐述系统设计、能力及架构,展示应用成果并展望扩展场景与未来计划。
Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力
上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提分,为大模型发展提供新方向。
LLM驱动的威胁情报提取框架,从非结构化到STIX的自动化:IntelEX
为应对网络攻击,需将非结构化网络威胁情报转化为结构化情报。IntelEX是自动化攻击级威胁情报提取工具,通过LLM上下文学习等增强,能识别攻击序列并提取结构化情报为STIX格式,还可转化成Sigma,在测试中表现优异。
实测!DeepSeek V4-pro是第一个接近Claude开源模型,前Meta研究员震惊
DAIR.AI创始人、前Meta AI研究员Elvis用DeepSeek - V4 - Pro在Pi框架搭LLM知识库,该模型开箱即用,完成知识密集型多步研究任务表现出色,在开源模型里Agent编程和推理能力强,架构设计让推理快且成本低。