「多传感器融合」共找到 4469 篇相关文章
巅峰对决:最强模型GPT-5.3-Codex与Claude Opus 4.6同时发布
OpenAI和Anthropic同时发布旗舰级模型GPT - 5.3 - Codex与Claude Opus 4.6。前者有网络攻防与自主代码修复能力,被评定为网络安全高风险;后者用自适应思考与上下文压缩处理长程任务,在多领域表现出色,但二者也都存在安全风险。
牛!小米开源「音频语言模型」,超1亿小时预训练时间,音频理解和输出能力是真顶!
小米推出开源音频语言模型MiMo - Audio,有超1亿小时预训练时间。它能理解音频,70亿参数模型在多基准测试达SOTA,音频理解超Gemini - 2.5 - Flash,复杂推理优于GPT - 4o - Audio,还支持多模态任务。
ICML2025 | 揭示MLLM的图文联动推理能力
当前多模态大语言模型(MLLMs)在图文深度融合推理能力上面临挑战,现有评测基准无法真正检验该能力。EMMA基准应运而生,它从四大领域精选题目,采用双重过滤机制和细粒度标注体系,评测发现MLLMs存在多模态推理危机。
一种基于滑动层合并的高效深度修剪大模型的方法
文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。
实测飞猪 AI:真正的突围才刚刚开始?
2026年上半年,AI行业面临盈利难题,AI Coding虽火热,但旅游等领域落地AI更具挑战与潜力。飞猪升级AI能力推出「飞猪帮帮」,能办事、融合交互方式,还解决通用模型痛点,不过落地成闭环仍需供应商适配。
更高智商更快思考!蚂蚁开源最新万亿语言模型,多项复杂推理SOTA
蚂蚁正式发布拥有万亿参数的通用语言模型Ling-1T,超越多个开源和闭源模型,在多项复杂推理基准中取得SOTA表现。它推理和代码能力强,研发采用‘中训练+后训练’,还提出新奖励机制和LPO方法。
Sora 2干翻Veo 3?超全对比实测:会中文脱口秀,但体操翻车,附有效邀请码
OpenAI推出Sora2,可生成20秒1080p视频,在物理准确性等方面更优,还具备音画同步能力。文章对Sora2和谷歌Veo3进行多轮对比实测,涉及不同场景,也提及Sora2版权保护及App相关情况。
独家丨华为、联想、富瀚微罕见「同框」,00后空间智能创业者连续获得两轮融资
魔芯科技近日完成新一轮近亿元融资,近两月连续获两轮近亿元融资。其创始人是00后浙大在读博士生。2025年公司研究成果被CVPR2026接收,还发布交互式视频世界模型。采用纯隐式空间表示,在多领域有突破。
Anthropic更新了Skill Creator,评测框架上线
Anthropic更新Skill Creator,上线评测框架。该框架无需写代码,能处理两类技能测试需求,可测试和改进技能,有捕获质量回归等用途。还增加基准模式、多Agent支持等,能让技能触发更可靠,更新已在Claude.ai等可用。
阿里通义开源GUI智能体SOTA:2B到235B端云协同重新定义移动端GUI智能体
阿里通义实验室开源MAI - UI,通过端云协同架构等解决GUI智能体部署难题。它全谱系模型设计应对硬件约束,自进化数据管线和在线强化学习提升性能,端云协同平衡隐私与效率,扩展动作空间打破局限,在多基准测试创SOTA。