「UGC视频增强」共找到 1352 篇相关文章
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
揭秘OpenAI 1.5万亿美元交易内幕:奥特曼核心圈子主导,绕开银行家和律师
OpenAI CEO Sam Altman与内部核心高管圈子主导1.5万亿美元系列交易,绕开银行家和律师。交易呈技术优先、财务后置非传统模式,如与英伟达、AMD等多笔重磅交易,还介绍了绕开外部顾问原因。
抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o
抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。
3年手搓ChatGPT!剑桥天才少年在Minecraft游戏中爆火回归
MC大神sammyuri时隔3年发布新作,在MC中复刻ChatGPT,名为CraftGPT。虽参数量小,但用Transformer架构,能和用户交互。模型训练用Python和小数据集,视频存档公布助理解原理。
Claude Sonnet 4.5 发布,30 小时自主编码刷新行业纪录
Anthropic发布Claude Sonnet 4.5,号称最强编程模型,自主编码达30小时。它性能超GPT-5等,Claude Code升级,文件处理、API能力增强,价格不变,多平台集成,还通过白盒审计提升安全性。
效果非常不错!阿里昨开源图形海报生成模型Qwen-Image
阿里昨日开源多模态图像基础模型Qwen-Image,基于20B参数MMDiT架构,在复杂文本渲染和精确图像编辑方面有重大突破,支持多风格图像生成、智能图像编辑等,还介绍了使用、部署等方法。
Docker Desktop 4.42 发布,带来原生 IPv6、集成的 MCP 工具包以及 AI 模型打包功能
Docker 公司发布 Docker Desktop 4.42 版本,增强网络灵活性、AI 工作流集成和模型分发功能,如新支持原生 IPv6、集成 MCP 工具包等。但 macOS 用户反馈稳定性下降,有启动、网络等问题。
微软上线Deep Research:OpenAI同款智能体,o3+必应双王炸
今天凌晨微软在官网宣布,Azure AI Foundry中上线Deep Research公开预览版,这是支持API和SDK的OpenAI高级智能体研究能力产品。它通过必应搜索与GPT系列模型深度协同,将研究流程全面自动化。
MariaDB LTS 年度发布集成了向量搜索
MariaDB发布2025年度LTS版本11.8,引入集成向量搜索功能,适用于AI驱动和相似性搜索应用。还增强了JSON功能,提供时态表。新向量数据类型利于机器学习等应用,同时解决了2038年问题。
哈佛重磅预警!经济学家预言:全球AI失业潮2年来袭,世界经济大崩盘在即
哈佛商学院视频采访美国经济学家Anton Korinek,他预警AGI可能2 - 5年实现,AI失业潮将席卷全球,经济或崩溃。他还谈及AI对经济影响、普通人应对办法,建议重新思考收入分配制度等。