「图像到三维」共找到 2523 篇相关文章
ICLR 2026 Oral | Revela:用语言建模重新定义稠密检索器训练
在检索增强生成系统中,稠密检索器是核心组件,但传统训练方法有局限。德国达姆施塔特工业大学蔡丰宇团队提出Revela,将检索器训练目标统一到语言建模框架,优势明显,实验效果佳。
Gemini 3「开眼」像素级操控!谷歌回应DeepSeek-OCR2
Google DeepMind为Gemini 3 Flash推出Agentic Vision,让模型主动编代码操控图像,性能提升5% - 10%。该能力已上线,谷歌还计划扩展功能。这或许是受DeepSeek-OCR2刺激,两者技术路线不同。
Databricks与OpenAI合作:企业级私有化GPT-5来了
OpenAI和Databricks深度合作,将把GPT - 5等模型原生集成到Databricks平台。企业可在自有数据环境运行模型,通过SQL等调用,Mosaic AI Gateway保障数据安全,多家企业表示期待。
来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!
OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。
Figure人形机器人首秀灵巧手叠衣服!神经网络架构不变,只增加数据集就搞定
Figure人形机器人首秀用灵巧手叠衣服,在未改变神经网络架构、仅增加数据的情况下,让原本用于物流场景的它习得新技能,完成了端到端的操作,还实现自然多模态交互。
一年三轮数亿融资!AI新材料研发企业鼎犀智创跑出加速度|甲子光年
AI新材料研发公司鼎犀智创近日完成数亿元Pre - A轮融资,是一年内第三轮。其以「RhinoAI智能研发平台」为核心构建研发闭环,推动材料研发从「经验试错」到「智能设计」,还与产业龙头合作,成果显著。
Google Gemini Embedding2:一个模型处理所有媒体类型
Google发布Gemini Embedding 2,首个原生多模态嵌入模型。能处理文本、图像等多种媒体类型,支持交错输入,覆盖超100种语言。与多模型串联方案比,延迟降70%、召回率升20%。已可在Gemini API等使用。
黄晓明开心麻花助演!智元机器人春晚太会整活了
智元机器人办了场“春晚”,让机器人当主演,还有黄晓明和开心麻花助演。节目形式多样,实现从“机器人演节目”到“机器人撑起一整台晚会”的质变。此外,今年还有宇树、魔法原子等四家官宣上春晚。
Altman承认“搞砸了”!曝 GPT-5.2 牺牲写作换顶级编程,明年成本降 100 倍,实锤Agent 已能永久干活
OpenAI CEO Sam Altman 在研讨会上勾勒 GPT-5 进化蓝图,承认 GPT-5.2 研发“搞砸”写作能力,承诺到 2027 年底其智力成本降 100 倍,还提出未来软件应“随需随生”,重构操作系统。
摩尔线程科创板IPO注册获批
10月30日,摩尔线程科创板IPO注册获证监会许可,是科创板‘1+6’改革后高效完成注册的硬科技企业。其从受理到过会仅88天,构建智算产品线,夸娥万卡智算方案优势明显。