多语言数据集」共找到 6490 篇相关文章

开源动态8

谢赛宁等推出统一模态模型!替代VAE实现图像理解/生成双SOTA,代码权重数据集全开源

谢赛宁等团队推出统一模态模型Blip3 - o,用扩散Transformer生成CLIP图像特征,采用顺序预训练策略。对比种设计方案,确定CLIP + Flow Matching最佳,模型在任务测试表现卓越且全开源。

量子位
新闻资讯8

与Generalist顶峰相见,30天狂吸30亿,千寻智能做对了什么?

2026年4月7日,千寻智能完成新一轮10亿融资,30天内累计融资30亿,由雷军、马云旗下资本领投。其开源具身模型Spirit v1.5展现泛化能力,技术路径获认可。千寻构建数据引擎,还通过现实场景数据反哺模型。

机器之心
新闻资讯7

GPT-5终于来了!在惊喜不的时代,它是否值得我们的等待?|甲子光年

北京时间8月8日凌晨1点,OpenAI正式发布新模型GPT-5。它是目前最强通用模型,在方面全面进化,将成ChatGPT默认模型。不过它虽有进步,但未掀起革命,GPT系列或难有飞跃,而OpenAI仍规划了未来发展。

甲子光年
产品应用8

神秘霸榜模型现真身:小米MiMo-V2 Pro,国内首个万亿参数+1M上下文,为Agent而生!

小米全新一代面向 Agent 的大模型家族官宣,包括 MiMo-V2-Pro Preview、MiMo-V2-Omni 和 MiMo-V2-TTS。MiMo-V2-Pro 性能优异,在场景实测表现出色,技术有创新,API 开放且定价低,已融入小米业务与生态。

机器之心
算法论文8

让大模型基于「图像事实」说话:用事实文本+自适应编辑,让语言偏见无处遁形丨ICLR'26

模态大模型看图常“脑补”,存在对象幻觉问题。北航团队提出AFTER框架,含FAS和QAO模块,能在主流LVLM和基准上显著降低幻觉,且推理开销低,为模态助手落地提供实用路径。

量子位
开源动态8

给GUI Agent装上「世界模型」:阿里通义用混合数据+统一思维链,让模型学会预判屏幕变化

伴随模态大模型发展,GUI Agent成人机交互新范式,但构建高可用、跨平台的GUI Agent面临诸挑战。阿里通义实验室开源Mobile - Agent - v3.5框架及GUI - Owl - 1.5模型家族,解决了相关技术壁垒。

量子位
开源动态7

4.4k星!给Agent接上「本地免费搜索爬虫」,内置11个skill执行数据搜索、爬取、自动研究

文章推荐开源本地搜索工具wigolo,它是专门给Agent使用的本地网络能力层,可解决本地运行Agent查找资料时使用API麻烦费钱的问题。它功能样,有搜索、缓存等工具,自带11个Skill。

开源AI项目落地
开源动态7

单Agent时代结束,AI们开始组团上班

月之暗面发布并开源K2.6,重点升级代码能力与Agent协作的“Agent集群”能力。K2.6在Artificial Analysis上取得全球开源第一,实测能并行交付格式成果,还展现出强大的全栈应用开发能力。

量子位
算法论文8

ICLR 2026 Oral | 告别步去噪!清华团队推出MVP,实现机器人动作单步极速生成

清华大学智能驾驶课题组 iDLab 与加州大学伯克利分校人工智能研究院 BAIR联合发表研究,提出 MVP 策略。它引入瞬时速度约束解决均值流学习问题,设计复合生成与选择机制,在任务测试中表现出色。

机器之心
产品应用8

微信自研高性能推理计算引擎 XNet-DNN:跨平台 GPU 部署大语言模型及优化实践

本文深入解析微信自研的高性能推理计算引擎 XNet-DNN,介绍其核心技术架构和性能优化策略。该引擎基于 RCI 框架构建跨平台 GPU LLM 推理能力,在方面超越现有解决方案,还给出了详实对比实验数据

腾讯技术工程