「构建时间优化」共找到 3301 篇相关文章
单次训练横扫9个基准,遥感检测最大数据集与基础模型框架问世
北京航空航天大学团队发布面向通用遥感目标检测的大规模数据集与基础模型框架 LEVIRDet,构建了 LEVIRDet - 159 数据集,提出 LEVIRDetNet 模型。前者为训练泛化能力强的模型提供新数据基础,后者在多基准测试中表现出色。
AI 时代的新可观测性:不只看系统崩没崩,还要看模型有没有胡说
New Relic首席技术战略官Nic Benders与主持人探讨可观测性从传统到AI驱动的演进,提及LLM与统计方法协同处理海量数据,还讨论了监控AI系统的难题及可观测性核心是理解业务目标。
两个哈佛女生用AI做电池故障排查,数月的工作量被缩到了几分钟
哈佛毕业女生 Eva Tuecke 和 Catherine Yeo 创立 Altara 公司,获 700 万美元种子轮融资。其系统能整合电池等物理科学领域分散数据,将故障排查时间从数月缩至几分钟,还能确保输出可审查,适应不同机构需求。
强化学习的进化:从PPO到MaxRL,LLM推理训练的算法演进史
本文概述2024 - 2026年推理LLM的强化学习进展,从REINFORCE和PPO讲起,介绍GRPO、RLOO等多种算法。指出critic模型非必需,标准差归一化有副作用,损失聚合很关键,信任域是优化切入点,还提出几个未解决的挑战。
“客户测950,不到一周下单了”,DeepSeek V4 逼出昇腾真功夫
昇腾计算业务副总裁张良透露昇腾近期销量好、认可度提高,大量客户基于其做训练。DeepSeek V4 考验昇腾,其超节点产品均支持。昇腾还对芯片体系和软件栈升级,拒绝仿 CUDA,坚持自主构建生态。
谷歌向左、李飞飞往右,阿里世界模型「快乐生蚝」杀出第三条路
阿里推出世界模型HappyOyster(快乐生蚝),基于原生多模态架构,有漫游和导演两大核心功能,可实时构建和交互。与文生视频模型不同,它能随时被干预。虽世界模型尚处早期,但应用场景广泛。
Pipeline MinerU真快不行了
文章聚焦Infinity-Parser,指出它把OCR从‘做识别’推进到‘做结构’。它采用layoutRL强化学习框架,结合真实与合成数据构建Infinity-Doc。跑分强且复杂结构表现优,透露Document AI向结构化生成转变趋势。
《动手写AI Agent》会话与记忆:记住上次聊到哪了
文章围绕《动手写AI Agent》的会话与记忆展开,指出LLM无状态、无会话持久化会让对话记录丢失。介绍了解决方案,如把对话存到磁盘及构建长期记忆,阐述设计决策并提到文件系统存储方案。
探针伸进大模型黑箱,南加州大学华人团队打造AI记忆研究的深空望远镜
南加州大学 Robin Jia 教授团队借助英伟达算力,构建基于 Llama 3 架构的全开源受控大模型 Hubble,其成果将在 ICLR 2026 亮相。研究揭示大模型记忆机制效应,还评估了‘机器遗忘’技术,有法律应用潜力。
告别人工干预!KDD Cup 2026 Data Agents 赛道:定义下一代数据智能体能力边界
KDD Cup 2026 发布 Data Agents for Complex Data Analysis 赛道,由香港科技大学(广州)和清华大学联合承办。旨在推动 AI 告别人工干预,具备自主任务分解等能力,还推出 DataAgent - Bench 测试平台,有丰厚奖励,公布关键时间节点。