「空间多模态数据集」共找到 3558 篇相关文章
Ilya 最新访谈,预训练时代终结后,AI行业来到了哪里?
Ilya接受90多分钟深度访谈,指出当前大模型泛化能力远不如人,Scaling时代终结,研究时代回归。还谈到AI经济影响与跑分不匹配、泛化能力鸿沟、情感价值等问题,预测超级智能5 - 20年到来。
AI把PC天花板打破了
IDC数据显示2025年第三季度全球PC出货量增长。联想2025/26财年第二财季财报亮眼,PC市占率首超25%,AI业务收入占比达30%。联想在多方面布局,对AI和AI PC潜力有信心。
和快手聊了之后才知道,传统搜索早变天了
文章从工程师视角剖析现代搜索,指出传统搜索难适应多模态内容世界。快手推出 UniDex 和 UniSearch,前者变革搜索倒排,后者为统一生成式搜索架构,二者成快手新一代工业搜索‘双引擎’,有广阔应用前景。
真机RL!最强VLA模型π*0.6来了,机器人在办公室开起咖啡厅
美国具身智能创业公司PI发布最新机器人基础模型π*0.6,新方法大幅提升具身智能成功率与处理效率。其开发的Recap方法从经验数据获训练信号,使模型能执行多项真实世界应用。
Coatue 最新报告:复盘 400 年、 30+ 次泡沫,我们离 AI 泡沫还很远
Coatue 最新报告否定‘AI 泡沫论’,结合市场与消费数据,表明 AI 拉动经济。复盘历史,推出‘泡沫评分标准’。反驳市场对 AI 的 8 大质疑,还指出谷歌转型成功,预计未来 AI 利润可观,给出投资原则与指标。
腾讯混元世界模型1.1开源:单卡秒级重建3D世界成为现实
腾讯混元团队开源混元世界模型1.1,它是混元3D世界模型1.0升级版。新增多视图及视频输入,单卡可部署,秒级创造3D世界。有核心突破,能处理多任务,经训练策略优化,多测试表现佳。
无VAE扩散模型! 清华&可灵团队「撞车」谢赛宁团队「RAE」
清华大学智能视觉团队和快手可灵团队联合推出《Latent Diffusion Model without Variational Autoencoder》,提出 SVG 框架,用预训练视觉特征编码器替代传统 VAE,解决了传统「VAE + Diffusion」范式的效率与通用性痛点。
开源PDF表单自动化神器,一行命令,把静态 PDF 变成交互表单!
平时拿到的PDF表单大多无法直接填写,操作繁琐。GitHub上的开源工具CommonForms能自动识别PDF表单区域,一键生成可填写的交互式表单,基于深度学习模型FFDNet,功能强大且使用简单,还保障数据隐私。
第一股AI亚文化兴起了
今年兴起由文生视频技术推动的AI亚文化,如AI生成的职场视频,主角是Sam Altman对历史名人进行PUA,国内外这类视频数据都很好。亚文化兴起特征是解构权威,且技术成熟促使其诞生。
EMNLP2025 | 探究大语言模型的语言共享神经元提升低资源语言能力
论文提出BridgeX - ICL方法提升LLM低资源语言性能,通过三步实现优化。构建两类探测数据解决传统问题,识别重叠神经元,用HSIC选最优桥梁语言,在多任务实验验证其有效,揭示多语言机制规律。