「结构化实验」共找到 2314 篇相关文章
VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。
全球排名前三,复旦自进化Harness Engineering让GPT‑5.4再涨7个点
2026 年以来,Harness Engineering 成业界热词。复旦大学等团队提出 Agentic Harness Engineering (AHE),可实现 Harness 自动优化。实验中,AHE 让 GPT - 5.4 分数提升,适配 GPT - 5.5 后排名全球第三,且有良好泛化能力。
传感器如何赋能精细化工行业?丨郭源生细说传感器
文章聚焦精细化工行业的智能传感器,阐述其应用前景、产业现状等。指出传统传感器短板,介绍前沿技术与传感器融合方案,预测市场规模与用量,分析智能化瓶颈并给出突破路径与建议,推动行业高端化升级。
迈向原生全模态AI智能体:人大&小红书发布OmniGAIA新基准
中国人民大学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。
瞄准AI、图形顶端战场:摩尔线程上演国产GPU硬核实力路演
摩尔线程首届 MUSA 开发者大会集中亮相技术体系。发布新一代统一计算架构 MUSA 路线图,介绍新架构、芯片及万卡集群,还涉及前沿布局,发起开发者培训,推出 AI 算力笔记本,宣告国产算力自主化时代加速到来。
把抖音的研发管理搬到车企,跑得动吗?
飞书项目在深圳新品发布会推出整车研发解决方案,首次明确‘平台化’定位并公开产品架构。其方案覆盖架构整合等四场景,还进行技术升级,如轻应用、Project 4K 计划等,已获车企实践验证。
IROS 2025 | 机器人衣物折叠新范式,NUS邵林团队用MetaFold解耦轨迹与动作
新加坡国立大学邵林团队提出MetaFold框架用于机器人衣物折叠。它创新分层架构,解耦任务规划与动作预测。构建开源数据集,经实验在多指标超现有方法,还验证了从仿真到现实的迁移能力。
大模型自信心崩塌!谷歌DeepMind证实:反对意见让GPT-4o轻易放弃正确答案
谷歌DeepMind携手伦敦大学研究发现,GPT - 4o、Gemma 3等大语言模型有“固执己见”和“被质疑就动摇”并存的冲突行为,原因与训练、决策逻辑、记忆机制有关。研究还通过两轮实验证实。
AI大模型浪潮下的认知重构:从一个数据老兵的转型思考
作者作为数据老兵,分享接触 ChatGPT 后的转型思考。指出 AI 使编程、数据分析师岗位巨变,填鸭式教育不再适用。强调认知结构是护城河,还探讨了 ETL、数据建模及 AI 原生产品变化。
全新预训练数据筛选方案,让数据效率提升10倍!配置仅需fastText评分器|港科大vivo出品
香港科技大学和vivo AI Lab提出轻量级高效数据选择方法PreSelect,已被ICML 2025接收。它只需训练部署基于fastText的评分器,减少10倍计算需求,在多数据集实验中效果显著优于其他方法。