3D视觉问答数据集」共找到 3065 篇相关文章

算法论文8

图像分词器造反了!华为 Selftok:自回归内核完美统一扩散模型,触发像素自主推理

华为盘古多模态生成团队推出 Selftok 技术,通过反向扩散将自回归先验融入视觉 token。它突破传统,实现因果 token、强化学习友好型 token 及纯 AR 大一统架构,实验在多方面表现优异,论文还入选 CVPR 2025 最佳候选。

机器之心
新闻资讯7

Agentic-Native 增长:Zilliz 如何用 AI Agent 支撑超线性业务扩张|AICon 深圳

2026年AICon深圳站8月21 - 22日举办,聚焦多关键方向,邀50+头部企业专家。Zilliz联合创始人郭人通将分享用AI Agent支撑业务扩张,介绍落地案例、关键实践及对数据基建新要求。

InfoQ
新闻资讯7

Claude骂声中启动「隐形水印」:新模型全量嵌入,标记所有文字

Anthropic宣布新款Claude将在生成文本中嵌入隐形水印,还会给特定文件附加数字签名元数据,全球统一施行。此前A社就用Unicode贴暗标,虽称不影响生成质量,但遭质疑。

量子位
算法论文8

让大模型自己写代码、自己进化,GIM和港大这篇ACL主会,把量化因子挖掘重做了一遍

香港大学和GIM提出CogAlpha框架,将Alpha从‘公式’升级为‘代码’,搭建7层21个智能体探索体系,让大模型参与研究流程。在5个数据集上跑赢21个基线方法,还具可解释性。

机器之心
算法论文8

让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法

南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型。

量子位
算法论文8

Yann LeCun离开Meta后首篇论文?使用了宇树机器人做研究

伯克利、纽约大学等团队发表论文,提出GenMimic方法,让机器人能零样本复现AI生成视频动作。Yann LeCun是共同导师之一。团队构建GenMimicBench数据集,经仿真和真实实验验证方法可行。

机器之心
算法论文8

解放军总医院联合南大、吉大等机构,共同提出首个「脊柱诊疗大模型」SpineGPT

解放军总医院联合多机构研发首个脊柱诊疗大模型 SpineGPT。研究指出通用 LVLM 有‘认知鸿沟’,团队构建 SpineMed 生态系统,含 SpineMed - 450K 数据集与 SpineBench 评估基准,SpineGPT 表现超越开源模型。

机器之心
新闻资讯8

具身智能「全明星日」来袭!智源组局30+行业掌门人,激辩机器人终极命题

2025年是具身智能「爆发之年」。智源具身2025 OpenDay上,30多位行业大佬激辩,议题包括具身架构、数据获取、硬件瓶颈、应用落地等,智源还开源多项成果助力行业发展。

新智元
算法论文8

仅需10%思维链标注,等同全量性能!中科院发布推理监督新范式

中科院计算所团队提出新框架PARO,让模型学习固定推理模式自动生成思维链,只需标注1/10数据就能达全量人工标注性能,适合规则清晰领域,为推理监督提供新思路。

新智元
开源动态8

Identity-GRPO:阿里开源多人物定制化视频生成的后训练优化算法

阿里团队提出Identity - GRPO算法解决多人物视频生成身份一致性问题。构建约15000个标注样本数据集,基于Qwen2.5VL设计奖励模型,多项策略增强训练稳定性,实验验证性能提升显著。

PaperAgent