「静态人物图」共找到 409 篇相关文章
NeurIPS 2025 | 蚂蚁CGM:图融合架构重塑代码大模型,探索非 Agent 新范式
在NeurIPS 2025上,蚂蚁将展示Code Graph Model (CGM)。它把代码库图结构集成到开源LLM,开启新范式,在代码库级任务上以非Agent方案登顶开放权重模型榜首,解决了复杂软件工程的Agent依赖难题。
前OpenAI灵魂人物Jason Wei最新演讲!三大思路揭示2025年AI终极走向
前OpenAI核心研究员Jason Wei在斯坦福演讲,提出AI发展三大思路。他认为智能会商品化、成本下降,自适应算力出现;所有能被验证的任务最终会被AI解决;AI智能呈锯齿状,不会瞬间超越人类。
“硬核芯科技园”圆满收官:汇聚中国芯硬核力量,勾勒自主创新全景图
2025年9月10 - 12日,SEMI - e深圳国际半导体展举行,“硬核芯科技园”特色展区汇聚10家优秀企业,展示全链条创新成果。底层技术突围,企业展示关键芯片与元件;产业生态共建,保障供应链稳定。
GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”
多模态大模型在高分辨率、元素密集的 GUI 场景易误判。苏州大学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。
拯救P图废柴,阿里上新多模态模型Qwen-VLo!人人免费可玩
昨夜阿里推出全新多模态模型Qwen-VLo,在原有能力上全面升级,有细节捕捉、图像编辑、多语言支持等亮点,不受固定格式限制。官方demo展示多种玩法,目前免费可玩,实测其编辑能力不错。
CVPR 2026|1分钟单图变4D视频!AI看图直接脑补物理规律
北京理工大学和理想汽车等团队提出全新框架PhysGM,引入DPO实现端到端快速前馈推理,能1分钟内将单图生成为4D动态视频,在速度和评价指标上超越主流模型,相关工作被CVPR 2026接收且代码已开源。
图生视频新玩法刷爆外网:图上画两笔就能动起来,终于告别文本提示
Higgsfield AI 是专注 AI 视频生成的初创公司,近期发布 Draw-to-Video 和 Product-to-Video 功能,前者画图形元素就能生成视频,后者可拖拽生成广告视频。它还常上新功能、集成热门模型,官网功能模板丰富。
ICCV2025 | One image is all you need,多模态指令数据合成,你只管给图,剩下的交给Oasis
近年来多模态指令数据合成依赖人工设计提示词,成本高。本文提出 Oasis 方法,仅靠图像生成数据,打破传统输入模式,还开源代码库 MM - INF。实验显示其数据多样,能提升 MLLM 性能。
WWW时间检验奖颁给唐建博士:图神经网络的十年远征与AI制药的底层逻辑
7月1日唐建博士2015年论文获WWW时间检验奖。其成果支撑多时代发展,延至BIO AI领域。百奥几何依托技术内核发展,GeoFlow历经三代跃迁,在多地实现成果落地,成国内AI制药领跑者。
NUS、牛津等联合发布音视频智能综述:系统梳理大模型时代的AVI全景图
NUS领衔近10家机构发布音视频智能综述,系统梳理大模型时代AVI发展全貌,涵盖感知、生成与交互,复盘子方向工作,构建任务蓝图,整理评测体系,总结基础技术,还探讨应用、安全及未来研究方向。