「通用空间感知」共找到 1459 篇相关文章
李飞飞押注的3D世界模型黑科技,被这篇论文一次性扒光!
李飞飞创业公司World Labs发布空间智能模型成果,推出Marble平台。本文分享3D、4D世界模型技术综述,系统梳理原生表示的世界模型,给出分层分类法、数据集与评测指标,并开源维护。
这个开源模型的UI审美碉堡了~
当下流行基于大模型生成HTML源码可视化文本内容,网页审美对模型很难。早期用Claude 3.7,后有DeepSeek V3 0324等。Tesslate开源基于Qwen微调的模型,尺寸全,审美佳,想象空间大。
AI视觉创作总差点意思?中科大等综述500+篇文献,系统分析生成一致性
中国科学技术大学等多机构研究者发表综述,梳理超500篇论文,揭示扩散模型视觉内容合成“一致性危机”,介绍三类一致性关系、加强位置、评估问题,指出未来模型需具备冲突感知等能力。
解放军总医院联合南大、吉大等机构,共同提出首个「脊柱诊疗大模型」SpineGPT
解放军总医院联合多机构研发首个脊柱诊疗大模型 SpineGPT。研究指出通用 LVLM 有‘认知鸿沟’,团队构建 SpineMed 生态系统,含 SpineMed - 450K 数据集与 SpineBench 评估基准,SpineGPT 表现超越开源模型。
刚刚,北大&360里程碑式突破!32B安全分碾压千亿巨兽
2025年9月23日,北大 - 360联合实验室发布TinyR1 - 32B模型,仅用20k数据微调就实现安全性能突破,兼顾推理与通用能力。还推出TinyR1 - Safety - 8B,且系列模型已全面开源。
李飞飞曝创业招人标准!总结 AI 大牛学生经验,告诫博士们不要做堆算力项目
近日,“AI教母”李飞飞接受采访,指出当前AI繁荣有局限,其初创公司World Labs将攻克空间智能。她回顾ImageNet项目,讲述AI发展历程,还分享创业招人标准、给博士建议等内容。
SIGGRAPH 2025 | CLR-Wire:曲线框可生成?可交互?深大VCC带你见证魔法
深圳大学黄惠团队推出 CLR - Wire 方法,将复杂三维曲线框结构编码到连续潜空间,解决传统难题,能实现高效生成与平滑插值,相关代码已开源,在多领域有应用前景。
刚刚,何恺明团队新作,「嵌入式语言流」ELF来了
何恺明团队提出ELF模型,将扩散过程置于连续向量空间,只在最后翻译成词。它用一个网络实现去噪和解码,引入自条件机制。实验显示,ELF用不到其他方法十分之一数据,生成质量全面领先。
刚刚,Anthropic新作:大模型意识被发现了
Anthropic 最新研究发现 LLM 有可被语言化报告的全局工作空间(J - space),用 Jacobian Lens 技术能读出模型思考概念、干预推理,还可暴露其未说出口的意图,为 AI 安全审计提供新途径。
Qwen-AgentWorld:一个语言世界模型,模拟七大Agentic领域
今天正式发布 Qwen-AgentWorld,它是首个原生语言世界模型,能在七大领域模拟智能体交互环境。同步发布 AgentWorldBench 评测基准。Qwen-AgentWorld 经三阶段训练,在评测中表现出色,还探索两种范式增强通用智能体能力。