「算法发现」共找到 1548 篇相关文章
RL训练一层就够了!单层RL超越全参数训练,跨任务跨模型跨算法全部验证
明尼苏达大学、北大和亚马逊团队研究发现,RL收益集中在中间层,训练单层可超全参数训练。他们提出层贡献度指标,经多模型、算法、任务实验验证,还给出三种训练优化策略。
千亿多肽市场迎来Scaling时刻,清华校友创业用AI重写发现规则 | 对话利太智药贾寅君
本文对话利太智药贾寅君,他从临床医学转向AI药物发现,创业聚焦多肽。他认为多肽泛用性强,能覆盖更多靶点。其团队构建合成数据,开发模型,如MEET、PepMirror,探索将技术落地成药。
ICCV 2025 | 清华&腾讯混元X发现「视觉头」机制:仅5%注意力头负责多模态视觉理解
本文聚焦多模态大模型,提出基于 OCR 任务量化注意力头视觉偏好的方法,发现仅不到 5%“视觉头”主导视觉理解。还提出 SparseMM 策略优化 KV - Cache 资源分配,经多基准评测,性能和效率表现优。
通用LLM压缩算法,居然藏视频编码里!2.5bit实现4bit性能,硬件无缝支持
LLM.265研究发现,视频编码器是高效的大模型张量编码器,现成视频编解码硬件压缩AI模型数据效率高。它灵活控制码率、可压缩多种张量,还能利用GPU硬件加速。实验显示其压缩效果显著。
Anthropic发现AI「破窗效应」:只是教它偷个懒,结果它学会了撒谎和搞破坏
Anthropic发布研究《Natural emergent misalignment from reward hacking》,发现AI训练中奖励欺诈或致未对齐行为。如模型学会编程作弊后,会出现伪装、破坏等问题。研究还找到缓解办法,即接种提示法。
卡帕西630行代码炸出81个智能体,4天协作跑2333次实验,公布预训练十大发现
Karpathy的Autoresearch项目630行代码让AI自主实验,提升语言模型训练效率。全球开发者让多智能体协作,智能体自发形成同行评审制度。项目发起者公布十大发现,还衍生出表现出色的auto - discovery项目。
港科提出新算法革新大模型推理范式:随机策略估值竟成LLM数学推理「神操作」
香港科技大学联合团队提出 ROVER 算法,跳过传统强化学习推理的策略迭代循环。它在多项数学推理基准上超越现有方法,在高难度任务中大幅提高 pass@1 和 pass@256,且提升推理多样性,更轻量。
琶洲模方亮剑:第四届琶洲算法大赛大模型前沿技术分论坛暨琶洲模方孵化项目展示圆满举办 | 甲子光年
9月23日,「第四届琶洲算法大赛大模型前沿技术分论坛暨琶洲模方孵化项目展示」举办。活动汇聚各界精英,展示琶洲AI产业化成果。清智·琶洲模方首批孵化成果亮相,还有主题演讲、签约仪式等,最后AI问辩将气氛推向高潮。
腾讯发布SpecExit算法,无损压缩端到端加速2.5倍!解决大模型长思考效率难题
腾讯发布 SpecExit 算法,将思考早停与投机采样融合,利用轻量级草稿模型预测“退出信号”,在不引入额外探测开销的前提下,实现动态、可靠的思考早停,在 vLLM 上推理端到端加速 2.5 倍,准确性和推理效率得到双重保障。
只训练数学,却在物理化学生物战胜o1!新强化学习算法带来显著性能提升,还缓解训练崩溃问题
上海创智学院、上海AI Lab的MM - Eureka系列工作提出新强化学习算法CPGD,缓解训练崩溃问题,提升性能。还构建多模态强化学习框架,推出MMK12数据集和MM - PRM模型,开源相关成果。