「跨领域数据」共找到 4195 篇相关文章
真机RL!最强VLA模型π*0.6来了,机器人在办公室开起咖啡厅
美国具身智能创业公司PI发布最新机器人基础模型π*0.6,新方法大幅提升具身智能成功率与处理效率。其开发的Recap方法从经验数据获训练信号,使模型能执行多项真实世界应用。
安谋科技Arm China闪耀2025全球计算大会|赋能绿色算力,加速AI普惠
安谋科技Arm China受邀出席2025全球计算大会,参与多项活动。深度参与撰写《算力经济绿色研究发展报告》,推进本地化标准建设,还在具身智能领域发力,其“周易”NPU IP将助力具身智能落地。
智源悟界 · Emu3.5 重塑世界模型格局:首提多模态 Scaling 范式,AI 理解世界再进化
北京智源研究院发布大规模多模态世界模型“悟界·Emu3.5”,它能模拟复杂动态物理世界,揭示“多模态Scaling范式”。该模型继承深化Emu3技术哲学,在多方面有提升,为世界模型领域提供进化路线。
Coatue 最新报告:复盘 400 年、 30+ 次泡沫,我们离 AI 泡沫还很远
Coatue 最新报告否定‘AI 泡沫论’,结合市场与消费数据,表明 AI 拉动经济。复盘历史,推出‘泡沫评分标准’。反驳市场对 AI 的 8 大质疑,还指出谷歌转型成功,预计未来 AI 利润可观,给出投资原则与指标。
牛津VGG、港大、上交发布ELIP:超越CLIP等,多模态图片检索的增强视觉语言大模型预训练
牛津VGG、港大、上交大团队论文提出ELIP方法,用学术界资源增强视觉语言大模型预训练,用于文字 - 图片检索。该论文被大会接受并获最佳论文提名。ELIP可应用于多个大模型,实验显示能显著提升图片检索表现。
VAE再被补刀!清华快手SVG扩散模型亮相,训练提效6200%,生成提速3500%
前脚谢赛宁宣告VAE在图像生成领域退役,后脚清华与快手可灵团队就推出无VAE潜在扩散模型SVG。它通过语义+细节双分支+分布对齐,实现多任务通用,训练提效62倍、生成提速35倍。
奥特曼考虑给ChatGPT加广告了!用8亿用户,救万亿债务
OpenAI凭ChatGPT有8亿周活与约130亿美元年收入,因订阅难覆盖成本考虑加广告,还获软银巨额投资,豪赌算力扩张;Anthropic低调攻企业,Claude在专业领域强,收入逼近OpenAI一半,打法稳健。
AI点外卖哪家强,美团LongCat团队做了个全面评测
美团LongCat团队发布贴近生活场景的大模型智能体评测基准VitaBench,以三大高频生活场景为载体,构建含66个工具的评测环境。评测显示现有智能体与应用需求差距大,该基准已全面开源。
开源PDF表单自动化神器,一行命令,把静态 PDF 变成交互表单!
平时拿到的PDF表单大多无法直接填写,操作繁琐。GitHub上的开源工具CommonForms能自动识别PDF表单区域,一键生成可填写的交互式表单,基于深度学习模型FFDNet,功能强大且使用简单,还保障数据隐私。
CoT 之后,CoF 如何让帧间逻辑从「隐式对齐」变成「显式思考」?
CoT 虽提升语言模型推理能力,但在 C 端场景有局限,且被质疑并非真实推理。视觉领域提出 CoF 概念,Google DeepMind 团队引入理论,让视频模型通过帧链推理提升帧间一致性,还具强大泛化能力。