低比特量化」共找到 1172 篇相关文章

产品应用8

AI圈再颠覆!中国AI翻译耳机通话翻译,实测震撼

科大讯飞发布全新AI翻译耳机,上海与迪拜连线对话实测表现震撼,响应延迟至两秒。其集成“端到端语音同传”技术,采用“骨导+气导”设计。此外,翻译机2.0也升级,科大讯飞在AI翻译领域优势显著。

新智元
新闻资讯8

GTC 巅峰对话 Jeff Dean x Bill Dally:预训练范式已死、延迟瓶颈不在计算、谈透 AI 五年未来 | GTC 2026

GTC 2026上,NVIDIA首席科学家Bill Dally和Google Jeff Dean展开重磅对话。讨论了模型能力进步、延迟推理架构、模型自主进化、数据与算力、训练与推理硬件差别等多方面内容,分享对未来AI的看法与见解。

AI科技大本营
算法论文8

RAG新SOTA,还在5亿条数据上跑进秒级,只有它了

本文围绕RAG技术展开,指出传统RAG在多跳推理等方面存在局限。介绍了GraphRAG、HippoRAG 2的优缺点,重点阐述Zleap AI的SAG方案,它用超边结构重构数据底座,在多跳问答测试中表现出色,还能在大规模数据下延迟落地。

机器之心
算法论文8

小模型大作为!微博的VibeThinker-1.5B超越DeepSeek R1等头部大模型

近年来,“参数越大,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发的VibeThinker - 1.5B用1.5亿参数和训练成本,在多项测试中超越头部大模型,还提出SSP框架和MGPO算法。

深度学习自然语言处理
产品应用8

Luma Uni-1.1 API开放,图像模型榜单第三,文字渲染直逼GPT image 2

今年图像生成模型迭代快,海外AI初创公司Luma将统一图像模型Uni - 1升级到1.1版并开放API。它在榜单排名前三,价格与延迟,有诸多品牌客户接入。展示了多场景应用效果,技术路线独特,定价有优势。

机器之心
算法论文7

超越Claude 3.5和o1!8B模型靠「分层投票+测试时训练」逆袭

近日MIT研究者发现测试时训练在大模型应对复杂推理问题时,能分解任务提升回答准确率。8B的lemma3模型经此方法,在ARC和BBH数据集上性能显著提升,超Claude 3.5等。但该策略部署效率

新智元
推荐文章8

Thinking Machines又发高质量博客:力推LoRA,不输全量微调

Thinking Machines 博客力推 LoRA 并与全量微调对比。研究发现小数据量任务中 LoRA 与全量微调效果接近,大数据量稍吃力,强化学习中秩 LoRA 也能接近全量微调。还揭示了 LoRA 关键要素、超参数规律等。

机器之心
产品应用7

回归C++: 在GGUF上构建高效的向量模型

Jina AI分享将纯解码器向量模型适配到GGUF格式及在llama.cpp工具链的优化经验。经处理得到特定任务v4模型,还生成量化版本并上传。介绍使用方法、注意事项,经测试推荐IQ3_S或IQ3_M版配合定制工具。

Jina AI
开源动态8

sgl-kernel MoE Align Block Size Kernel 优化过程解析

文章记录SGLang的sgl-kernel中优化 `moe_align_kernel.cu` 的过程。MoE模型的 `moe_align_block_size` kernel从最初的baseline版本经多次迭代,包括加向量化padding、用Blelloch Scan并行化前缀和、用Warp Scan减少同步开销等。

GiantPandaLLM
新闻资讯7

阿里千问大模型换将,32岁林俊旸官宣告别

阿里巴巴高级算法专家、通义千问大模型负责人林俊旸宣布告别千问团队,此前一晚千问团队刚推出Qwen3.5轻量化模型且获马斯克点赞。此外,Qwen3.5核心贡献者Kaixin Li和通义实验室科学家Binyuan Hui也发文告别,几人去向未明。

量子位