「任务复杂度」共找到 2029 篇相关文章
清华团队:1.5B 模型新基线!用「最笨」的 RL 配方达到顶尖性能
清华团队用两个 1.5B 模型证明,用最基础的 RL 配方可达到小模型数学推理能力 SOTA。单阶段训练加固定超参数实现 SOTA 性能且省一半算力,训练曲线还很平滑。
推理时扰动高熵词,增强LLM性能
香港科技大学(广州)研究团队发现LLM推理时,一小部分高熵词显著影响输出正确性。基于此提出MTI方法,含Selective CFG intervention与Lightweight negative - prompt guidance,无需额外训练,能提升模型推理能力。
自动化浏览器
Skyvern是能自动化浏览器操作的工具,底层靠大语言模型和计算机视觉。它提供简单API接口,可在大量网站自动化手动操作,替代易出错的自动化方案。介绍了其原理、使用方法、功能等。
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。
每周7亿人都在如何用ChatGPT?OpenAI最全报告来了
OpenAI联合哈佛大学经济学家发表论文《How People Use ChatGPT》,基于内部对话数据,分析ChatGPT从2022年11月上线到2025年7月的使用情况。截至7月,周活超7亿,每周发消息180亿条。
炸裂黑科技,脑波沟通来了!AlterEgo让你在大脑中发声
AlterEgo是一种非侵入式、可穿戴的外围神经接口,能让人用自然语言与机器等交流,无需发声。它始于2018年MIT媒体实验室,2025年初独立运营,可用于帮助语言障碍者,还能融入日常生活。
Claude 代码框架之战
开发者尝试让Claude做繁琐编码工作,自己担任高价值角色。当前开发者社区正进行“Claude代码框架之战”,文中给出设计Claude工作流的八个选择及搭配套餐,指出设定框架能让AI发挥最大效力。
狂肝一周,测评十余款 PPT AI 生成产品的真实反馈
评估 Agent 产品能力复杂,以 PPT 生成为例,有 Agent 和模板化两种流派。作者选前者投票测评、后者全方位测试。给出方案,还推荐不同需求适用产品,附总榜单和细致体验描述。
「Tokens是胡扯」,Mamba作者抛出颠覆性观点,揭露Transformer深层缺陷
Mamba作者Albert Gu在博客中探讨状态空间模型(SSM)和Transformer权衡,抛出‘Tokens是胡扯’观点,揭露Transformer深层缺陷,如分词问题、处理噪声能力弱等,还分析两类模型特点及结合优势。
DeepSeek推理最高提速6倍!开源研究:加装「思维进度条」,计算量减少30%
特拉维夫大学团队开发新方法,给LLM推理任务装进度条,控制推理深度和速度。提出“思维进度向量”TPV预测推理位置,干预TPV可“超频”“降频”,模型已在GitHub开源。