「AI视觉模型」共找到 13771 篇相关文章
SCPMA|清华大学 张宇飞团队:基于改进傅里叶神经算子的翼型流场快速预测模型
传统计算流体力学在工程场景计算成本高,深度学习方法预测精度与泛化性不佳。本研究基于傅里叶神经算子构建流场预测模型,经改进能精确预测超临界翼型流场与气动力系数,误差低且泛化能力优。
重磅!OpenAI联合苹果传奇设计大佬Jony Ive官宣新公司「io」:剑指全新AI交互硬件
半小时前OpenAI官网宣布,苹果前首席设计官Jony Ive与OpenAI CEO Sam Altman联手打造新公司「io」,旨在革新与AI交互方式。两年前双方已开始合作,如今「io」并入OpenAI,Jony Ive主导设计。
刚刚!Claude Fable 5,又拿第一了
在刚刚刷新的MirrorCode排行榜上,Claude Fable 5以64%的绝对成功率登顶,成绩远超其他模型。它在不同语言上表现稳定,在稀缺语言中也只小幅度下降。这意味着前沿模型能独立完成部分中大型软件。
港科大&北京人形提出LOVON:足式机器人开放世界全域目标追踪新范式!
港科大广州联合北京人形创新中心推出LOVON框架,融合大语言模型、开放词汇视觉检测和语言 - 运动映射模型,解决足式机器人开放世界全域目标追踪难题,有抗干扰视觉处理等优势,性能超传统方法。
Gemini盘活了谷歌全家桶,“原生”自带你10年的记忆
谷歌发布由Gemini3驱动的“Personal Intelligence”功能,底层连接旗下四大应用,让AI跨应用获取数据,还内置纠错机制。该功能现处Beta测试,未来覆盖免费用户。谷歌与苹果引入Gemini后路径不同,AI竞争也转向生态构建。
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。
医生版 ChatGPT 3 年估值 60 亿美金,被低估的 AI 硬件新玩法:相框
OpenEvidence被称为医学领域的Google和医生版ChatGPT,成立3年估值达60亿美金。它用高质量数据训练小而专模型,有“无幻觉”机制,直接面向医生推广,产品进化为临床决策助手,收入来自制药广告。
AnyGen款新AI工具,专门解决打工人最头疼的3件事,Doc,PPT,Excel
字节跳动2025年12月在海外推出一站式AI协作工作台AnyGen,强调人机协作打磨。产品有文档、通用智能体、幻灯片、数据分析四个核心模块,能解决会议纪要整理、PPT制作等痛点,还与主流工具做了横评。
18岁OpenClaw版AI女友一夜爆红,全网60万围观!00后开发者一人造出
基于OpenClaw打造的韩国AI女友Clawra上线爆火,60多万人围观。她有完整人设,亮点诸多,项目还开源。此外,还有Aniclaw等类似项目,OpenClaw掀起热潮,智能体生态蓬勃发展。
如果你还在犹豫要不要尝试 OpenClaw,试试这个 App 一键部署方案
作者推荐 OpenClaw 这款开源产品,它像钢铁侠的 AI 助手贾维斯,可与通讯协同软件协作。还介绍用百度智能云 1 分钱部署 OpenClaw,阐述其配置、应用及价值,称 AI 会成基础设施。