「应用视觉团队」共找到 5606 篇相关文章
刚刚,Gemini攻克「宇宙弦」终极难题!AI科学家最优雅解法震撼物理学
Google Research团队用Gemini Deep Think + 树搜索框架,攻克理论物理领域宇宙弦引力辐射功率谱精确解析解难题。AI探索600条候选路径,找出6种解法,最优雅的格根鲍尔方法让物理学家拍案叫绝。
数据邪修大法好:仅用文本数据就能预训练多模态大模型
多模态大模型研发中,行业认为无图文对就无多模态能力。但ReVision研究表明,预训练阶段昂贵配对关系非必需,利用非配对数据统计信息修正文本表征,能实现跨模态互换,降低成本。
推理效率狂飙60倍:DiDi-Instruct让扩散大模型16步超越千步GPT
普渡大学等研究者提出 DiDi-Instruct 后训练方法,可将扩散大语言模型推理加速 60 倍,超越传统 GPT 模型。该方法实现推理效率与效果双提升,为大语言模型落地提供新方案。
比思维链准43%!逻辑脑+大模型直觉,推理可靠性大幅提升
中德研究团队发布成果,给大模型外挂「逻辑脑」,结合答案集编程与LLM,构建神经 - 符号框架,提升空间推理准确率,让AI能说清逻辑、跨任务迁移,迈向更可靠的通用推理。
斯坦福AI虚拟实验室炸场了!几天设计92种纳米抗体,90%以上实验可行,这才是真正的AI科学家!
斯坦福大学和Chan Zuckerberg Biohub团队开发AI驱动的“虚拟实验室”,能自主研发COVID - 19纳米抗体,90%以上候选药物实验可行。AI在药物研发各环节优势显著,国内AI制药也有进展。
ICCV 2025 | ECD:高质量合成图表数据集,提升开源MLLM图表理解能力
科研等领域图表是信息核心载体,先进开源MLLMs在高难度图表理解测试准确率低。本文提出ECD数据集,规模大、质量高、风格多样,还设计合成流水线与评测基准ECDBench,为开源MLLM提供支持。
X-SAM:从「分割一切」到「任意分割」:统一图像分割多模态大模型,在20+个图像分割数据集上均达SoTA
中山大学、鹏城实验室、美团联合提出X - SAM,统一图像分割多模态大模型。它将分割范式扩展,设计通用输入输出,采用端到端架构和三阶段训练策略,在超20个数据集达最优,为图像分割研究开辟新方向。
Omni-Effects:首个统一多特效生成框架
Omni-Effects是面向多样化定制视觉特效生成的统一框架,结合纯提示词驱动与空间感知提示,可精确控制特效位置。构建Omni - VFX数据集验证其有效性,在复杂场景有高鲁棒性。
刚刚,Ilya官宣出任SSI CEO!送走「叛徒」联创,豪言不缺GPU
Ilya现身X发文,自封SSI唯一CEO,Daniel Levy任总裁,此前跳槽Meta的联创Daniel Gross出局。Ilya拒绝Meta 320亿美元收购要约,称专注事业,有算力和团队,要构建安全超级智能。
具身数据来了实战派!40天2轮融资数千万,瞄准物理AI基础设施
近日,具身智能数据基础设施公司元点科技完成数千万元融资。其创始人郭江亮认为具身智能竞争进入下半场,本质是数据竞争。元点用MatrixOS构建数据基础设施,业务与生态全面铺开,团队实力强,瞄准2027 - 2029窗口期。