视觉大模型」共找到 9269 篇相关文章

开源动态7

推出 AnyLanguageModel:在 Apple 平台统一本地与远程语言模型的 API

语言模型是构建现代软件的重要工具,但 Apple 平台开发者集成模型困难。Hugging Face 发布 AnyLanguageModel,是 Swift 包,可替代 Apple Foundation Models 框架,支持多模型服务商,降低使用 LLM 难度。

Hugging Face
开源动态8

32B 稠密模型推理能力超越 R1?中国秘密 AI 团队发布推理小模型 AM-Thinking-v1

2025年,国内神秘A - M - team在Hugging Face开源32B推理模型AM - Thinking - v1。它在多推理评测中击败DeepSeek - R1,与超规模模型成绩相当。团队靠后训练方案挖掘32B模型潜力,探索小体量实现能力路径。

AI科技评论
新闻资讯8

MiniMax M2 发布即爆,拿下开源模型第一名

10月27日,MiniMax发布新一代文本模型M2及由其驱动的MiniMax Agent。M2是专家混合模型,参数达230B但激活仅10B。它在开源模型评测中夺冠,能低成本、高速度支撑工作流,开发者评价高。

MacTalk
开源动态8

Jina-VLM:可在笔记本上跑的多语言视觉模型

Jina AI 发布 2.4B 参数量的视觉语言模型 Jina-VLM,在多语言视觉问答任务达 SOTA。它引入注意力池化,连接视觉与语言基座,支持 29 种语言,能高效处理问答等任务,对硬件需求低。

Jina AI
新闻资讯7

AI圈深夜乱斗!OpenAI、谷歌、Anthropic发布新模型,集体翻车?

昨晚,OpenAI时隔六年再次开源`gpt-oss-120b`和`gpt-oss-20b`,Anthropic发布`Claude Opus 4.1`,Google发布Genie 3及写故事书功能。不过OpenAI新模型幻觉率高,Anthropic更新提升有限。

探索AGI
产品应用7

Qwen3接连放出No Thinking, Thinking两模型,Gemini2.5 pro顶不住啦

Qwen推出非推理模型`Qwen3 - 235B - A22B - Instruct - 2507`后,又放出推理模型`Qwen3 - 235B - A22B - Thinking - 2507`。非推理模型在多方面功能增强,推理模型能力强,超DeepseekR1,可试用。

CourseAI
开源动态8

从今天起,开源前五,全!是!中!国!!模!型!

短短一年,LMArena开源模型榜单前五全被中国模型占领,智谱Z.ai登顶,阿里、DeepSeek等紧随其后。LMArena是权威评测平台,盲测机制保证排名真实。中国模型性价比高,正用开源和低价占领市场。

AGI Hunt
新闻资讯8

独家解读|2025年AI五趋势与底层数据革命

2025 年 AI 发展重心转移,高质量数据成新基石。本文解读五技术趋势,如多语种 TTS 与全双工交互、多模态模型等,还介绍了各趋势的数据需求及数据堂提供的相应数据服务方案。

机器之心
产品应用8

Agent、图像、视频全是版本升级:春晚还没开,豆包AI就火了

2026年AI市场竞争激烈,海外公司密集发布新模型致华尔街震动。国内腾讯、阿里、字节参战,字节官宣豆包参与春晚互动。2月14日火山引擎宣布豆包系列模型全面升级,含模型2.0、图像模型Seedream 5.0 Lite、视频模型Seedance 2.0。

机器之心
算法论文8

腾讯提出Vision-SR1:让模型真正学会“看图思考”,而不是“蒙答案”

视觉语言模型(VLMs)存在视觉幻觉和语言捷径问题,限制其可靠性和泛化能力。腾讯提出Vision - SR1训练方法,通过推理分解和自我奖励机制,不依赖外部监督,提升模型视觉感知和推理可靠性。

深度学习自然语言处理