视觉原语」共找到 871 篇相关文章

新闻资讯8

GPT-5.2果然反超谷歌Gemini 3 Pro!北大数院校友核心贡献

OpenAI在成立十周年推出GPT - 5.2,相比GPT - 5.1在多实用领域更强,视觉理解等能力提升。ARC - AGI测试中得分超谷歌Gemini 3 Pro。拆解其多方面能力,还介绍核心团队多为数学专业新面孔。

量子位
产品应用8

阿里又上好货了!Qwen3-TTS能力大幅提升

阿里刚发布Qwen3-TTS(2025-11-27版),解决音合成核心问题。它音色大幅扩展,有49种高品质音色;言和方言能力提升,支持10种主流言与多种方言;韵律和速优化,拟人化近真人;API调用简单。

AI工程化
推荐文章8

为什么 2025 的基模公司都押注 Interleaved Thinking?

本文探讨 2025 年基模公司押注 Interleaved Thinking 的因。从大模型迭代说起,介绍其在多模型中的体现,阐述该思维链对 Agent 的重要性,还提及 MiniMax 在推动其成行业标准上的诸多努力及带来的影响。

MacTalk
新闻资讯7

DeepSeek V3.2爆火,Agentic性能暴涨40%解密

文章解密了DeepSeek V3.2 Agentic性能暴涨40%的因,即采用交错思维链机制。还对比了其与早期ReAct范式,介绍其效果、理,以及MiniMax为落地该机制做的工作,最后提到多家模型达成技术共识。

新智元
开源动态8

混元3D开源端到端全景深度估计器,代码+精选全景数据已上线,在线可玩

全景深度估计在3D视觉领域日益受关注,但因全景数据稀缺、球面畸变问题,以往方法零样本泛化和效率不佳。腾讯混元3D团队提出DA²,通过数据扩充引擎和SphereViT架构,提升性能,展现SOTA表现。

量子位
算法论文8

理解帮助生成?RecA自监督训练让统一多模态模型直升SOTA

统一多模态模型在视觉理解和生成能力上不平衡,常理解强但生成弱。本文提出重建对齐(RecA)自监督后训练方法,不改动架构,用未标注图像训练,在多模型实验中提升性能,部分达SOTA。

机器之心
开源动态8

社区供稿 | 阿里国际Ovis2.5重磅发布:以小博大,刷新开源模型性能新高度

阿里国际发布多模态大模型Ovis2.5,在OpenCompass综合得分提升,保持SOTA水平。它在生分辨率视觉感知等三方面突破,有9B和2B两版本,代码、模型等资源已开源,技术理涉及架构、训练与数据。

Hugging Face
新闻资讯7

“还我GPT-4o”!奥特曼强推GPT-5惹怒网友,紧急公关来了

GPT-5上线后遇冷,OpenAI直接关闭既往所有型号,让网友不满。因是GPT-5人机感重,缺乏写作创意和情感共鸣。无奈之下,奥特曼宣布付费用户可切换回4o,同时会继续更新GPT-5。

量子位
开源动态8

小红书团队开源dots.ocr:文档解析新王者,性能比肩Gemini!

文档解析领域处理多言复杂文档需高效能力,传统OCR工具存在不足。小红书HiLab开源多言文档解析模型dots.ocr,基于1.7B参数视觉言模型,性能达SOTA,单页PDF处理快,公式识别媲美大模型。

开源星探
产品应用7

只提升2个点?我实测Claude 4.1后,发现官方在骗人

官方更新Claude 4.1,作者实测其与Claude4、DeepSeek R1在生成UI设计图、卡片、网页游戏开发等方面的能力。结果显示Claude 4.1进步大,尤其在理解提示词和视觉设计能力上,还能精细修改多文件。

AI产品黄叔