主流语言」共找到 1597 篇相关文章

算法论文8

GAG:超越RAG,无需检索的私有知识注入新范式

在高价值私有场景,主流大模型注入知识的路线各有硬伤。中科院和360AI联合团队提出GAG方案,无需检索、固定底座、单Token、即插即用,实验显示效果佳,也指出跨域组合等局限。

PaperAgent
算法论文8

大模型幻觉的源头找到了!清华团队锁定大模型宁愿说谎也要讨好人类的神经元

清华大学研究团队深度解剖大语言模型微观机制,确认幻觉关联神经元存在,揭示其与过度服从行为相关。通过干预神经元激活状态可增减模型幻觉行为,为开发可靠 AI 系统提供靶点。

AIGC开放社区
开源动态8

微软的prompt压缩方案-LLMLingua,开源

使用大语言模型时,提示信息长会致运行慢、费用高、易超限。微软推出的LLMLingua可压缩提示信息,有完整开源。它历经多版本演进,还能用于安全防御,使用简单,值得开发者跟踪。

AI与安全
新闻资讯7

大模型可否胸有成竹?探索LLM推理与自信心的关系 | 直播预约

本次全英文直播将探讨大语言模型推理能力扩展瓶颈,介绍以置信度为核心的推理视角,展示“自确定性”指标及应用,还会讨论方法有效性和“基于置信度的推理”意义。

深度学习自然语言处理
开源动态8

阿里重磅开源 0.5B TTS + 0.8B ASR,支持跨语种音色克隆、说唱识别!

2025 年 AI 圈风向变了,开始卷端侧模型。阿里 FunAudioLLM 团队发布 Fun - CosyVoice3 0.5B 和 Fun - ASR - Nano 0.8B,TTS、ASR 双线程开源,是工程级版本,目标是在本地跑顺‘听 + 说’。

开源星探
新闻资讯8

谷歌TPU杀疯了,产能暴涨120%、性能4倍吊打,英伟达还坐得稳吗?

摩根士丹利研报显示,谷歌TPU产能将爆炸式增长,供应不确定性基本解决。TPU性价比高,在推理领域优势明显,或终结英伟达垄断。文章还给出TPU与英伟达GPU的选择建议及不同利益相关者的应对策略。

机器之心
算法论文8

准确率腰斩!大模型视觉能力一出日常生活就「失灵」

EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。

量子位
算法论文8

Meta通过简单算术解锁LLM SoTA性能

大型语言模型训练耗算力与时间,传统模型融合方法有局限。本文提出SoCE新方法,通过筛选专家模型、非均匀加权平均融合,在多评测中实现先进性能,为LLM优化提供新思路。

深度学习自然语言处理
算法论文8

模型汤新做法!Meta|提出“类别专家汤”:SoCE,大幅提升模型性能,刷新SoTA!

语言模型领域,提升性能常需高算力、大量数据和长时间训练。Meta提出新型模型汤技术SoCE,通过分析类别相关性操纵模型权重,在BFCL上刷新SOTA记录,为开源社区指明低成本进化之路。

AINLPer
算法论文8

谷歌DeepMind最新论文,刚刚登上了Nature!揭秘IMO最强数学模型

谷歌DeepMind的AlphaProof在IMO获接近金牌的银牌成绩。它结合大模型直觉、强化学习和Lean形式化证明解题,虽在速度、泛化和读题上有局限,但开启了人类数学家与AI协作新阶段。

新智元