工信部」共找到 373 篇相关文章

算法论文7

腾讯LLM团队:对下一个 Token 预测的深入剖析,多样性 or 精准度?

最新研究证实RL能增强LLM推理,但成效受限预训练token分布。腾讯LLM把交叉熵重写成单步策略梯度,用超参压熵,为RL打造‘低熵高号’起点,经实验验证低熵模型优势明显。

PaperAgent
算法论文8

大模型长脑子了?研究发现LLM中层会自发模拟人脑进化

帝国理学院等机构研究人员发表论文,指出大型语言模型(LLM)学习中会自发演化出类似生物大脑的协同核心结构。研究对多个模型剖析,揭示其内处理规律,为大模型可解释性开辟新路径。

机器之心
新闻资讯7

明天上市,MiniMax上市额度已经被抢疯了

大模型公司MiniMax 1月9日将敲钟上市,创下港股IPO机构认购记录,超460家机构参与认购,超额认购70多倍。它受头基金青睐,暗盘涨幅24.6%,收入源于AI产品与服务,分投资者看好其收支平衡。

机器之心
新闻资讯7

14000人一夜失业!被裁白领挤爆TikTok,含泪直播失业全程

亚马逊本周宣布裁1.4万员,占白领4%。被裁员在TikTok、LinkedIn等平台记录失业瞬间,社交媒体成“失业直播间”。AI早已融入作流,此次裁员或与AI投入有关,传统白领体系正被重新编码。

新智元
新闻资讯8

OpenAI杀疯了!内神秘模型首次斩获息学奥赛IOI 2025金牌,碾压98%人类选手

OpenAI研究员官宣其内研发的AI推理系统在2025年国际息学奥林匹克竞赛获金牌,超越98%人类选手。该系统在模拟人类环境下靠推理解题,用通用模型,一年间成绩大逆转,近期在多赛事表现出色。

AI寒武纪
开源动态8

超越DeepSeek-R1,英伟达开源新王登顶!14万H100小时训练细节全曝光

英伟达Llama - Nemotron系列模型超越DeepSeek - R1且全开源。论文揭秘其训练关键,如用合成数据监督微调与强化学习等。还介绍构建阶段、架构设计等,评估显示该系列模型在多任务表现出色。

新智元
新闻资讯7

新版GPT Image 2.5已经能伪造GPT-6发布会了

GPT-6还未发布,新版生图模型GPT Image 2.5就能伪造其发布会。它升级幅度大,测试显示能伪造奥特曼全员等,在LMArena测试有生成快、图像逼真等特点,生图或成GPT-6主打功能。

量子位
新闻资讯8

陈大年复出,入局大模型

国产大模型领域黑马StartLux-V1.0-27B-Preview,参数量仅27B,在通院MCP测试中排综合第二,仅次于1.6万亿参数量的DeepSeek-V4-Pro。其创始人陈大年押注本地模型,公司专注该领域商业化。

量子位
产品应用7

newtype OS操作手册

作者黄益贺介绍newtype OS安装、配置与使用方法。它是定制化具,比Claude Code更适合知识消化与内容产出。安装简单,配置需连模型供应商、给Agent配模型,使用时与Chief对话即可。

newtype AI
算法论文7

这次,LLM黑盒被LLM打开了~

随着大语言模型(LLM)能力提升,其内机制更不透明。概念描述新范式用另一个 LLM 自动生成自然语言解释。介绍了描述对象、生成方法、评估指标,还提及社区关注方向,指出结合多种手段才能把解释变知识。

PaperAgent