长度泛化能力」共找到 3408 篇相关文章

开源动态8

超越纯视觉模型!不改VLM标准架构,实现像素级深度预测

Meta开源DepthLM,首证视觉语言模型不改架构就能媲美纯视觉模型的3D理解能力。通过视觉提示等创新策略,它精准完成像素级深度估计等任务,为多领域带来前景。

新智元
算法论文8

MSSP | 西北工业大学马启悦,高传强等:融合激波位置的跨声速抖振气动载荷辨识

本文提出融合激波位置的跨声速抖振气动载荷辨识方法,从时序流场提取激波特征,用稀疏辨识构建参数化代数方程,增强预测精度与泛化能力,为准确预测跨声速气动载荷提供新思路。

力学与人工智能
开源动态8

Codex给V4-Flash装上眼睛,DeepSeek也会文档OCR

GitHub上的项目codex-vision-proxy让接进Codex的DeepSeek能看图,不用换模型或等官方,装本地代理即可。它还附带视觉工具包,在智能文档解析和OCR上潜力大,证明多模态能力可长在管道上。

CourseAI
产品应用7

港股新贵押注物理AI,乐动机器人打造万亿市场空间的核心基础设施

物理AI时代,机器人需「读懂」物理环境,环境感知能力成竞争焦点。乐动机器人过去十年围绕此布局,有空间感知技术先发优势,其自研模型与架构构建数据飞轮,有望完成向感知基础设施平台的身份重塑。

量子位
产品应用8

生数科技认领神秘登顶模型:AI视频公司拿出工业级Demo,跨本体跑通复杂长程任务

生数科技认领神秘登顶模型MotuBrain,该模型4月中旬悄登两国际benchmark。它将预测与行动统一,具一脑多型等能力,技术上走边看边动路线,有响应快等优势。生数科技双轨布局,Vidu与MotuBrain同根。

量子位
新闻资讯8

AI破解500年《纽伦堡编年史》天书!仅用1小时,隐藏惊天真相被揭开

500年前《纽伦堡编年史》中的手写注释难倒人类学者,Gemini 3.0 Pro仅用1小时就给出解读,识别出注释与圣经年代学体系计算有关。它攻克视觉识别、解读缩写、还原历法转换表三大难题,展现惊人能力

新智元
产品应用7

抢先体验GenFlow2.0:未来多Agent协作的理想形态

作者在百度邀测会抢先体验Genflow 2.0,用其解决小学教改信息查询问题,还让它生成创意图片。它得益于“沧舟OS”,有流畅、并发且跨模态能力,架构全自研,测试版亮点多,值得期待8月正式上线。

AI产品黄叔
新闻资讯8

刚刚,Sam Altman宣布:GPT-5即将发布

Sam Altman在X上宣布OpenAI通用推理系统在2025年IMO达金牌水平,同时透露GPT - 5即将发布。OpenAI研究员Alexander Wei介绍突破细节,模型解决多道题获35分。GPT - 5是实验模型,有金牌能力的版本还需等待。

AGI Hunt
产品应用8

全球首创!B站推出影视级TTS语音模型,支持零样本语音+情绪双克隆,精准时长控制!

近日,B站语音团队推出全新一代语音合成模型IndexTTS2,提供影视级音质、情绪克隆和时长控制。其情绪与时长精细控制功能全球首创,还具备零样本语音克隆等能力,支持本地运行与中英文双语。

开源星探
新闻资讯7

快问快答|AI都会写代码了,还要不要报考计算机专业?!

在AI大模型能写代码的背景下,InfoQ采访王昊奋、谭晓生、邹欣,探讨高考是否报考计算机专业。他们就专业前景、核心价值转变、核心能力等发表看法,还提及课程调整和其他专业选择。6月30日直播将深入探讨。

InfoQ