静态人物图」共找到 408 篇相关文章

算法论文8

科研数据不再碎片化!一张可计算,连起整个科研世界

UIUC研究团队打造ResearchArcade,将ArXiv论文、OpenReview评审等碎片数据连接成动态知识谱。它有多源、多模态等特征,支持多种格式数据导入导出,定义了六个任务,验证了结构在科研数据处理中的作用。

新智元
开源动态8

Identity-GRPO:阿里开源多人物定制化视频生成的后训练优化算法

阿里团队提出Identity - GRPO算法解决多人物视频生成身份一致性问题。构建约15000个标注样本数据集,基于Qwen2.5VL设计奖励模型,多项策略增强训练稳定性,实验验证性能提升显著。

PaperAgent
算法论文8

Depth Anything再出新作!浙大&港大出品:零样本,优化任意深度

浙江大学与港大团队推出「Prior Depth Anything」,融合深度传感器数据与AI深度,一键补洞、降噪、提分辨率。无需额外训练,可提升3D模型深度质量,零样本刷新多项深度处理纪录。

新智元
算法论文7

多模态模型挑战北京杭州地铁!o3成绩显著,但跟人类有差距

近年来,多模态大模型在多种场景取得进展,但能否‘看懂’存疑。西湖大学等团队提出评测基准ReasonMap,评估模型在地铁理解中的能力,发现主流模型有瓶颈,闭源模型虽优但仍逊于人类。

量子位
开源动态8

Google 把翻译能力彻底开源了!TranslateGemma:550种语言通吃,还能直接看翻译!

Google将多年积累的翻译能力灌进开源大模型TranslateGemma,它基于Gemma 3,专为翻译任务调优,有3个规模版本,覆盖550种语言,能直接看翻译,亮点颇多。

开源星探
新闻资讯7

独家|美入局 Visual Agent,Chance AI 完成数百万美元天使轮融资

布局下一代视觉 AI 入口,领投 Visual Agent 创业公司 Chance AI 数百万美元天使轮融资。该公司成立于 2025 年 8 月,从北美大学生切入,有独特产品逻辑,融资后将推进多方向发展。

Founder Park
开源动态8

AI 出为什么总很土?2100 星开源 Skill 用 244 行给了答案

AI出常显土气,开源项目`gc - minimal - zine - poster`用244行文档给出答案。它将日系zine感拆分为可执行指令,规定九个渲染问题,还给出取值区间和自检方法,能防止风格自我复制,且适配多种Agent。

AI Reading Hub
新闻资讯7

视频版Nano Banana来了!内置Gemini世界知识;原版香蕉出仅需4秒

谷歌开放Gemini Omni Flash API,将多模态推理与视频生成编辑结合,有4项关键能力,也有局限。Nano Banana 2 Lite出快且便宜。二者串联使用,像生成与视频创作可无缝衔接。

量子位
新闻资讯8

马斯克狂砸16亿「买」他5年!揭秘特斯拉2号人物,那个睡工厂的狠人

特斯拉授予全球汽车业务高级副总裁朱晓彤超52万份股票期权,价值2.33亿美元,需坚守5年完成KPI。他出身非典型,从建设充电网络到拯救特斯拉上海工厂,后成全球二号人物,还将助力Optimus量产。

新智元
算法论文8

DeepSeek又又又又发新论文了!这一次,他们重构了AI看的方式

DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布的DeepSeek V4,有望实现原生多模态。

花叔