「多模态数据集」共找到 3299 篇相关文章
百度搜索变天了:怎么搜索你们定
百度 App 搜索框大改版,升级为智能框,支持多模态输入,降低使用门槛。还推出多项功能,如百看、智能创作、深度搜索等,接入 MCP 服务,推动产品能力多方面转变,探索新盈利模式。
重磅!翁荔最新Scaling Law深度洞察来了
北大毕业的前OpenAI高管翁荔(Lilian Weng)的《Scaling Laws, Carefully》值得一读。Scaling law是预训练预算表,能帮少烧错钱。文章探讨大模型训练预算分配,分析Kaplan和Chinchilla结论差异及数据稀缺问题。
小钢炮开源,一张3090两小时「从零训练0.1B全模态模型」,模型训练彻底平民化
MiniMind - O是开源超轻量级端到端全模态大模型,采用双轨架构。仅需一张RTX 3090,2小时就能从零训练全链路。有两套训练数据,具备零样本声音克隆等特点,实现大模型训练平民化。
微信测试中心刷新业界标准,斩获 ICCV 图像质量评估挑战赛冠军
微信测试中心IH-VQA团队在ICCV 2025 MIPI赛事夺冠,其首创的iDetex方案刷新业界标准。该方案能精准定位图像失真,提升评估可解释性,已在微信多业务落地,未来将深耕多模态质量评价等领域。
红杉中国xbench全球首发,AI智能体真实战力揭榜!
红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。
本地Opus你要不要!Qwen3.8-27B开源
阿里Qwen团队开源Qwen3.8-27B,上线2天登顶Hugging Face全球大模型趋势榜,下载破百万。其性能超Opus4.6,与顶尖模型相当,量化后普通电脑就能跑,原生多模态,编程、Agent、多模态跑分表现出色。
AI原生数据库的思考
文章围绕AI原生数据库展开,分析企业应用大模型的问题,指出AI场景驱动数据库新工作负载。探讨AI数据库变与不变、实现路径,介绍原生混合搜索、现代数据架构、数模融合等,还提及seekdb的发布、定位、优势与不足。
马斯克「世界模拟器」首曝,1天蒸馏人类500年驾驶经验!擎天柱同脑进化
特斯拉官宣「世界模拟器」,可模拟、合成自动驾驶的「孪生世界」,生成不同视角和长尾场景。它基于端到端神经网络,有学习人类价值观等优势。还能用海量数据解决难题,输出可解释中间结果,为自动驾驶和擎天柱训练服务。
谷歌AI Overview上线!Reddit遭殃,Agent笑了~
Google搜索兑现I/O上提到的AI搜索能力,上线AI mode、AI overview,目前部分结果中有广告。Reddit成谷歌AI首个受害者,其依赖谷歌流量且签有数据授权协议。而overview对利用browser use的Agent是利好。
起猛了,机器人开上卡丁车了!
Symbiosis Robotics放出机器人开卡丁车新演示,还推出Direct Perception Control(DPC)。它取消中间运动表示,让模型结合画面、任务和身体反馈直接算关节与手部目标,团队还整理15,010小时具身数据。