「数据处理」共找到 3299 篇相关文章
18岁华人开源成果,火爆具身智能赛道
18岁华人小哥Eddy Xu的初创公司Build AI开源了有史以来最大的人类为中心数据集Egocentric - 10K,含10亿帧画面,规模是同类的100倍,场景扩展至工厂。不过其缺乏多模态信息,且human - centric路线也有局限。
基于 Gemini 模型做 SEO Agent 简单实战
作者参加 Google I/O 大会后,受 James 用 AI 做 SEO 启发,尝试基于 Google 的 Gemini 2.5 Pro 模型制作 SEO 智能体。介绍数据获取方法,构建 3 个 Agent 进行分析、提建议和输出报告,Gemini 负责理解决策,适合出海企业。
刚刚,Meta 发布新模型,股价大涨 10%
Meta发布新模型Muse Spark,是原生多模态推理模型,支持多种功能。其沉思模式处理复杂问题表现佳,还有新购物模式。虽评论区有质疑,但Meta股价大涨。模型未开放API等,实际实力待察。
390亿美元,全球具身智能第一估值来了!英伟达持续加注中
与OpenAI分道扬镳后,Figure C轮融资获超10亿美元承诺资本,投后估值达390亿美元。资金将用于扩大人形机器人大批量制造与部署、搭建GPU基础设施、启动数据采集项目,助力具身智能发展。
刚刚,DeepSeek最新发文!V3/R1训练细节全公开,信息量巨大
网信办新规生效,DeepSeek回应,标注AI生成内容,公开V3/R1训练细节。介绍训练分预训练和优化训练,深挖数据使用,还谈及推理、开源情况,也提到对抗AI幻觉与滥用风险的措施。
ICCV 2025 | 跨越视觉与语言边界,打开人机交互感知的新篇章:北大团队提出INP-CC模型重塑开放词汇HOI检测
北大团队提出 INP - CC 模型重塑开放词汇 HOI 检测。它提出交互感知提示生成和概念校准两项创新,结合输入图片特性构造提示集合,引入‘困难负样本采样’策略,在两大数据集上表现超 SOTA。
李飞飞押注的「世界模型」,中国自研Matrix-3D已抢先实现了?
中国自研世界模型Matrix-3D可单张图生成3D世界,效果对标李飞飞的World Labs,还能实现更大范围探索。它有诸多优势,技术上有创新,数据集有特点,应用前景广泛。
LiteReality来了!用一张扫描图还原真实3D世界
剑桥大学提出 LiteReality,可将室内 RGB - D 扫描数据转为 3D 虚拟副本,支持多种图形渲染功能,适用于多领域。它通过多步骤流程重建场景,还引入新框架解决材质恢复问题,但也存在依赖人工等局限。
GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!
第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。
实测最新开源的DeepSeek-OCR后,我有些不一样的看法,有些话可能只有我敢说
实测最新开源的DeepSeek - OCR,它并非传统OCR,不适用于传统场景。其最大意义是解决大模型上下文长度问题,通过文字图片压缩解压提高处理速度。模型功能多样,是让AI看图思考的新思路。