「通用视觉模型」共找到 8146 篇相关文章
10% KV Cache实现无损数学推理!这个开源方法解决推理大模型「记忆过载」难题
推理大模型推理时易现冗余问题,R-KV开源方法登场,显存降90%、吞吐提6.6倍、准确率达100%。它通过实时对token排序解决冗余,还经多步骤压缩KV缓存,性能测试表现出色,适用多场景。
Transformer开始构建三维世界:开源模型几张图片秒级生成可探索3D场景
影溯将最新研究成果做成免费3D捕捉工具Crystal空间相机,背后技术QuerySplat已开源。其模型Topos - Lite改变组织三维空间方式,少量图片就能秒级生成3D场景,还能扩展容量。影溯团队经验丰富,技术应用场景广。
GPT 4o-mini华人领队离开OpenAI:真正推动AI进步不是模型架构,而是互联网
前OpenAI研究员Kevin Lu加入Thinking Machines Lab,该公司2025年7月获约20亿美元早期融资,估值约120亿美元。Kevin Lu曾主导GPT - 4o mini发布,他认为真正推动AI进步的是互联网,而非模型架构。
大模型手语翻译新进展:CAPO-SLT拿下中文三项最高分 | EMNLP'26
vivo AI Lab团队针对自动手语翻译生成中,无视觉证据支撑的错误累积导致语义偏移的痛点,提出置信度感知策略优化方法CAPO-SLT,仅调整强化学习更新规则,不修改主干网络,在中文手语翻译测试中拿下三项指标最高分,成果将发表于EMNLP'26。
狂涨26.5K star!一个接口搞定20+AI大模型,开箱即用,太香了!
文章介绍开源项目One API,它是LLM API管理与分发系统,能统一管理主流AI模型,用一个接口搞定调用。有友好界面和可视化操作,在Github获26.5K star,还介绍其性能特色、安装使用方法。
2.6K Star!超逼真端侧TTS模型,0.5B参数3秒音频即时克隆!
文章介绍开源项目NeuTTS Air,它是免费、轻量级超逼真语音合成模型,仅0.5B参数,媲美商用TTS引擎,能在低功耗设备运行,支持3秒音频克隆声音,还给出使用步骤和应用场景。
懂方言,通诗词,精通30国语言,阿里发布语音识别大模型Fun-ASR1.5
阿里发布语音识别大模型Fun - ASR1.5,可精准识别30种语言,覆盖中文七大方言体系及二十余种地方口音,强化古诗词诵读专项识别,后处理环节优化标点预测和文本归一化,降低人工成本。
代码碾压一切!OpenAI神秘模型o3-alpha一夜刷屏,却遭41岁大神绝地反杀
OpenAI神秘模型o3 - alpha曝光,代码能力强大,疑似在编程大赛获亚军,不敌人类选手Psyho。ChatGPT Agent也实力惊人。比赛组织者指出AI代码优化强,但缺人类创造力。
Manus 重新独立:这七个月一直没停下,但通用 Agent 的牌桌已经挤满了玩家
8月11日,Manus宣布将恢复独立运营,此前它被Meta收购仅七个月。过去七个月其产品更新频繁,年收入大幅增长。但通用Agent竞争激烈,OpenAI等大厂及创业公司纷纷入局,Manus需做深产品,且重新独立后面临增长考验。
2026 开年 AI 巨作!超强搜索智能体模型 MiroThinker 1.5 开源,慢思考做到了极致!
2026年开局,MiroMind团队开源超强搜索智能体模型MiroThinker 1.5。它不是“秒回型AI”,会深入研究后输出有引用、数据和逻辑的研报,以“慢思考”机制在深度任务上表现出色。