大语言模型」共找到 9378 篇相关文章

算法论文8

性能提升11.74%!腾讯优图提出激励推理,专攻复杂指令

现有大语言模型处理复杂指令能力不足,腾讯优图研究团队提出激励推理方法。该方法能提升LLM处理复杂指令表现,在1.5B参数LLM上性能提升11.74%,媲美8B参数模型

量子位
新闻资讯7

英伟达员工晒年终奖,黄仁勋霸气签皮衣;Moltbook爆火:当AI有了自己的社交网络;又一“95后”清华天才科学家庞天宇加盟腾讯混元 | Q资讯

本文汇总 AI 行业热点,有 Moltbook 成 AI 社交平台且爆火;OpenAI 两款产品用户流失;亚马逊、Meta 裁员;英伟达年终奖、合作协议情况;阿里发布千问新模型;还有厂春节发红包竞争,DeepSeek 布局新领域等消息。

InfoQ
开源动态8

没想到,32B清华DeepDive掀翻深度搜索全场的!

文章指出模型在真实深网搜索场景表现不佳,核心矛盾是缺‘难搜’数据和多轮工具调用 RL。清华 DeepDive 用数据合成造‘难搜’题,端到端多轮 RL 训练,在 BrowseComp 刷新开源记录,迁移能力也强。

PaperAgent
产品应用8

Qwen3.8-Max首发上线阿里千问AI平台,API服务与Token Plan同步开放

今日,阿里巴巴发布新一代基座模型Qwen3.8,千问AI平台首发其Max版API服务与Token Plan。Qwen3.8参数量2.4万亿,性能居前列,推理快且能自主编程。API性价比高,平台还为Token Plan用户提供优惠。

阿里云开发者
算法论文8

重复一下提示词,Gemini准确率竟从21%飙升至97%!

Google Research团队研究发现,重复提示词可让Gemini准确率从21.33%升至97.33%。该策略能提升主流模型非推理任务表现,在多模型多基准测试中优势明显,且不增加延迟。

AIGC开放社区
算法论文8

美团LongCat扎扎实实做了件难事:LLM数学新天花板AMO-Bench

美团LongCat团队联合高校推出AMO - Bench,用50道原创奥赛级难题评估LLM数学能力。它解决现有基准测试痛点,经四重把关构建,测试显示顶级模型表现不佳,也揭示模型提升空间

PaperAgent
产品应用7

AI文本转语音进入“Next Level”!独角兽ElevenLabs发布Eleven v3:狠狠拿捏情感控制

独角兽ElevenLabs发布最新版TTS模型Eleven v3,支持70多种语言,能进行多人对话,生动展现情绪语气。官方称其为“迄今为止最具表现力的文本转语音模型”,网友实测好评居多,但中文效果不如英文。

量子位
产品应用8

88天登录193次!顶级证据+循证医学,让500万中国医生拥有「神助攻」

国内医生面临高负荷工作与医学知识快速更新的挑战,通用模型在医学场景中存在高幻觉率问题。阿里健康推出医学AI产品「氢离子」,具备低幻觉、高循证特点,有四层循证架构,还与多方合作构建数据壁垒。

机器之心
算法论文8

0.25秒识破未见攻击,这套检测方法没看过任何越狱样本 | EMNLP'26

视觉语言模型带来隐蔽攻击面,现有检测器难平衡。中国人民学与阿里巴巴集团联合提出Learning to Detect(LoD),不依赖攻击样本和手工规则,从模型内部激活学安全模式,实验效果好且代码开源。

量子位
新闻资讯8

哇塞,今天北京被机器人人人人人塞满了!

世界机器人会在北京开幕,100多个新机器人亮相。智平方的爱宝机器人人气爆棚,它能用一个基座模型完成多任务。其搭载的GOVLA模型有四核心能力,且已在多行业商业化落地。

量子位