多模态处理能力」共找到 4420 篇相关文章

产品应用7

Jina 第4版:多模态向量检索,统一适配,挑战3大任务

Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能。

CourseAI
新闻资讯8

炸裂!Claude以第一作者写论文反驳苹果「推理模型根本没有推理能力」:苹果有三大错误

苹果论文称推理模型无推理能力,引发争议。Anthropic的Claude Opus以第一作者写论文反击,指出苹果研究有混淆‘推理失败’与‘输出截断’等三大问题,还通过实验证明模型能力,强调需更聪明评估方法。

AI寒武纪
算法论文7

复旦等推出「第一人称视听基准」,补齐多模态模型「听觉拼图」

多模态大模型在真实世界会“失聪”,现有第一人称视频问答/理解基准长期偏“视觉中心”。复旦等团队推出首个系统评测第一人称声音理解能力的基准EgoSound,能让模型听懂世界,评测显示当前模型与人类差距大。

量子位
开源动态8

华为开源7B多模态模型,视觉定位和OCR能力出色,你的昇腾端侧“新甜点”来了

华为推出开源多模态模型openPangu-VL-7B,适配昇腾端侧。它推理性能性价比高,在多核心任务表现突出,技术报告还披露核心技术细节,为昇腾使用者带来新选择,丰富昇腾生态。

量子位
开源动态8

视觉Token注入CLIP语义,走向多模态理解与生成新范式

腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。

量子位
新闻资讯8

马斯克发布 Grok 4 模型:推理能力较前代提升 10 倍,各学科测试接近满分

xAI 发布 Grok 4 及 Grok 4 Heavy 模型,推理能力较前代提升 10 倍,多测试接近满分。马斯克称其为世界最好 AI。它在多方面表现出色,如长任务能力强、推理效率佳等,但代码能力欠佳,且付费昂贵。后续还将推多款模型。

Founder Park
新闻资讯7

GPT-5内测抢先公布:日常推理首次击败人类,编程数学科学问题能力都很强

疑似GPT - 5发布预告刚出,内测体验抢先释出。网友实测其推理能力首超人类,编程、数学等能力也出色,虽提升或没GPT - 3到GPT - 4明显,但市场竞争激烈,8月8日凌晨OpenAI发布或为GPT - 5。

量子位
开源动态8

终于开源升级OmniGen2,统一多模态图像生成模型,真的惊艳。

OmniGen2是强大的开源统一多模态图像生成模型,针对文本和图像模态构建独立解码路径,运用未共享参数。新架构提升处理效率和质量,在图像编辑等任务表现出色,还有多技术特点。

开源AI项目落地
产品应用8

WAIC现场最“聪明”展台!AI眼睛耳朵能力全打开了

WAIC现场,声网展台被观众挤爆,其新奇“AI玩具”都能与玩家流畅对话。声网对话式AI引擎全新升级,新增选择性注意力锁定、视觉理解能力,能与主流数字人方案集成,还可接入大模型,价格低。它已在多领域落地。

量子位
开源动态8

商汤科技与南洋理工大开源空间智能多模态SOTA模型

商汤科技与南洋理工大学构建800万量级三维空间数据集,训练出开源SOTA多模态基础模型SenseNova - SI系列。该系列模型在多个权威测试中表现出色,部分超越GPT - 5,还展现出泛化等能力,且能赋能具身智能。

AIGC开放社区