「OpenS2S」共找到 2091 篇相关文章
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
抖音&LV-NUS开源多模态新模,以小博大刷新SOTA,8B推理比肩GPT-4o
抖音SAIL团队与LV - NUS Lab联合推出多模态大模型SAIL - VL2,以中小参数规模在106个数据集实现性能突破。该模型从架构、数据、训练三方面创新,后经全链路优化,在多数据集验证中表现卓越。
大模型IMO25数学竞赛成绩公布了
大模型挑战IMO 2025成绩出炉,Gemini 2.5 Pro以超30%总成绩断崖式领先,超出第二名89%。测试由MathArena组织,采用统一环境和双人匿名评估。还介绍了测试模型、题目及模型表现,人类版结果预计本周六发布。
性能超越李飞飞,他们把10亿高斯点的3D世界装进浏览器
群核科技开源3D高斯浏览器Aholo Viewer,渲染速度和大场景加载性能超Spark2.0,能让任何设备浏览器流畅运行10亿+粒子的超大3D场景。它还带动信息载体范式跃迁,推动AI理解三维世界。
6位前DeepMind老将打造「AI指挥官」,一半成本刷新SOTA
6名前Google DeepMind成员创立Poetiq,搭建元系统让前沿大模型自动生成解决特定任务的策略和模型组合,降低推理成本。其Gemini 3 Pro优化技术在ARC - AGI - 2上创SOTA,成本仅为之前最优方法一半。
DeepMind 没舍得开源的 Genie 3,被昆仑万维放出来了
过去一周世界模型赛道热度高涨,DeepMind发布的Genie 3未开源,昆仑万维却在8月12日推出自研升级版Matrix - Game 2.0并完整开源。它定位产业化,能让世界模型从实验室走向生产线,还带来盈利模式转变。
宇树新机器狗太猛了!1米高石阶轻松爬,越野快到出残影,网友:这不是AI生成的???
宇树新机器狗Unitree A2星际猎影实力惊人,全视频无加速展示跑酷、爬山等技能。它有超广角激光雷达3D感知系统,能自主避障,还很轻、强、快,承载能力佳,官方未公布售价和上市日期。
开源 AI 文档生成器!给代码库做个CT扫描,一键生成交互式Wiki文档!
介绍开源工具DeepWiki-Open,它由AsyncFuncAI开发,能将GitHub或GitLab仓库一键转为交互式Wiki,基于多种技术实现代码分析和自动化文档生成,解决开发者理解复杂代码库的痛点,还给出快速上手步骤和适用人群等。
小米造芯:一个失败者重整旗鼓
小米曾在2017年澎湃S1铩羽而归,2021年重启手机SoC设计研发。此次玄戒O1一次流片成功后回片,表现超预期。文章分析了小米此前失败教训,介绍其芯片战略,还谈及产业特点与小米面临的挑战。
OpenAI新模型Day0就被嫌弃!排名拉垮,不如一月底发布的国产模型
OpenAI推出GPT - 5.4 mini和nano模型,主打快速经济,针对编程等优化。但评测中GPT - 5.4 mini排名不佳,不如国产Kimi 2.5,且价格对比有争议。不过与自家旧版比有提升,网友测试有亮点。