小模型性能」共找到 8766 篇相关文章

开源动态8

刚刚,DeepSeek全新多模态技术开源!

DeepSeek联合北大、清华开源多模态技术及论文,提出“视觉基元推理”框架,解决MLLM指代鸿沟问题。基于DeepSeek - V4 - Flash构建的模型性能比肩GPT - 5.4等。论文还介绍架构、训练流程等。

PaperAgent
新闻资讯7

今天,Anthropic偷偷移除了Pro用户的Claude Code访问权

Anthropic一度将Claude Code从Pro套餐移除,引发开发者不满,数时后官网回滚,负责人称是范围测试。Claude Code因高消耗或调整收费,Anthropic正修正订阅模型,这或改变开发者工具格局。

新智元
开源动态8

SGLang-Diffusion: 两个月进展

自2025年11月初发布,SGLang - Diffusion获广泛关注。过去两月持续优化,速度提升1.5倍。介绍新模型支持、LoRA支持等进展,还展示性能测试结果,阐述关键改进及未来规划。

GiantPandaLLM
算法论文7

The Batch: 881 | 一千万 token 的输入上下文

Google的Ali Behrouz等人设计“记忆模块”集成到类transformer架构ATLAS,能处理一千万token输入。它替代注意力层,训练后在长上下文任务中表现佳,但模型,大规模表现未知。

DeeplearningAI
算法论文8

梁文锋署名!DeepSeek再发炸裂论文:提出“条件记忆”新范式,彻底打破GPU推理显存墙

来自DeepSeek的新论文提出“条件记忆(Conditional Memory)”新范式,推出Engram模块,实现可扩展知识查找。研究揭示U形缩放定律,构建的Engram模型性能超越纯MoE基线,还打破了GPU显存瓶颈。

AI寒武纪
产品应用7

Jina 第4版:多模态向量检索,统一适配,挑战3大任务

Jina第4版基于Qwen2.5 - VL模型扩展,支持单向量和多向量输出。它经对比学习和任务特化训练,推理时可按需选LoRA适配器,能利用多模态处理能力优化不同任务性能

CourseAI
开源动态7

Kimi团队深夜潜入Reddit开了场AMA,他们都聊了些什么?(据说代号4494就是杨植麟本人)

今日凌晨,Kimi团队在Reddit社区开展AMA交流,解答大家疑问。期间回应Claude蒸馏争议,探讨编程写作侧重、参数模型需求、缩放定律等问题。K2.5表现出色,K3值得期待。

开源AI项目落地
开源动态8

2.4K Star!米最新开源!覆盖600+语种的语音克隆TTS,40倍实时合成速度!

米k2 - fsa团队开源OmniVoice,这是支持600 + 语种的零样本语音克隆TTS模型性能超ElevenLabs v2和MiniMax等标杆,RTF低至0.025,合成速度快40倍,还支持声音设计等功能。

开源星探
算法论文8

NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临

传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。

机器之心
开源动态8

一图胜千言被实现了!DeepSeek-OCR用图片压缩文本,10倍压缩率

DeepSeek开源DeepSeek - OCR,用图片压缩文本达10倍压缩率且几乎不丢信息。它解决了以往视觉编码器的问题,架构清晰,数据丰富,性能测试亮眼,为解决大模型‘记性差’问题提供新思路。

AIGC开放社区