「和合生态行动」共找到 7584 篇相关文章
从视觉压缩,到视觉记忆:MonkeyOCRv2以重建保留文档页面证据
文档视觉编码器对LLM理解和推理很重要。MonkeyOCRv2提出‘重建即文档视觉记忆’,通过多组实验验证其有效性,还发布MonkeyDoc v2数据集,推动公平比较的研究文化。
所有Harness终将长成“龙虾”,但最后活下来的只有几只
在用户需求驱动下,工具从 LLM 向 Agent、Harness 再到 Claw 自然进化,但用户能容纳的 Claw 有限。Sam Bhagwat 拆解进化路径,指出各阶段核心竞争力,开发者应抢占用户心智空间。
维纳智能登上Nature通讯:AI不只会回答问题,开始生成高精度行业数据
维纳智能登上Nature通讯,其让大模型自动生成高精度推理数据,用闭环反馈驱动专业Agent自主演化。该公司在多领域交出工业级精度答卷,还解决了Agent泛滥的困局,推出多款创新产品。
单次训练横扫9个基准,遥感检测最大数据集与基础模型框架问世
北京航空航天大学团队发布面向通用遥感目标检测的大规模数据集与基础模型框架 LEVIRDet,构建了 LEVIRDet - 159 数据集,提出 LEVIRDetNet 模型。前者为训练泛化能力强的模型提供新数据基础,后者在多基准测试中表现出色。
YOLOv8-SST:水面小目标检测极致改进,降低漏检
浙江水利水电学院董慧贞团队提出YOLOv8 - SST算法,针对水面小目标检测的噪声干扰、定位不准、泛化能力弱三大痛点分别改进。经实验,该算法提升了检测精度,推理速度也能满足实时需求,还给出了实战代码。
GAIR Paper 106|追踪视觉 Token 的演化轨迹,实现无损压缩与 60% 推理加速|CVPR 2026
近年来大视觉语言模型虽推动多模态智能发展,但推理成本高昂。山东大学和MBZUAI团队提出TransPrune,从演化视角衡量视觉Token重要性,保持性能无损同时降低60%推理成本。
ACL 2026 | Spatial-Agent:地图Agent全新概念转换范式
论文 'Spatial-Agent' 提出地理空间问答应建模为 'concept transformation',引入 GeoFlow Graph 中间表示。它从自然语言问题构建图结构,再映射到工具调用。实验显示其对地图任务有帮助,还指出构建地图类 agent 需稳定数据源等。
高潮从第几秒开始?GaMMA 让多模态大模型真正「听懂」音乐时间线
现有多模态大模型难以理解音乐时间线。复旦大学与字节跳动团队提出 GaMMA,采用双编码器融合网络,经三阶段训练,还推出 MusicBench 评测基准。实验显示,GaMMA 在多基准上表现优异,刷新 SOTA。
Done!硅谷分拣快递的人类工作,没了
美国具身领域明星企业Figure让搭载Helix 02大脑的Figure 03机器人进厂分拣快递,8小时不间断直播引超两百万网友围观。这源于一场网络battle,机器人操作速度接近人类,不过也会犯错。
大型挂机现场:马斯克的55万英伟达GPU,利用率才11%
《The Information》报道,马斯克旗下xAI有55万英伟达GPU,利用率仅11%。原因包括大规模部署协调难、数据传输瓶颈和训练间歇性。这是行业普遍问题,xAI着手解决,设定50%利用率目标。