优化方法」共找到 2560 篇相关文章

推荐文章7

直播预约 | 如何缓解LLM-as-a-Judge的潜在偏好?UDA:一种无需人工标注的无监督去偏对齐框架

论文针对不同大模型对同一组大模型回答打分差异大等问题,提出无需人工标注、模型无关、即插即用的UDA框架,以无监督方式动态调整Elo评分,实验表明该方法能降低打分标准差、提升与人类评分相关系数。

深度学习自然语言处理
产品应用8

32倍加速,58秒搞定720p视频!字节发布离散自回归框架,统一视觉生成和长视频生成

字节发布InfinityStar框架,将5秒720p视频生成时间从30多分钟缩至58秒,还支持多样任务。它基于对视频本质思考设计时空金字塔模型,将时空分离,通过多项技术优化,性能表现出色,不过也存在一些技术局限。

AIGC开放社区
推荐文章7

这个时代最缺的是「个人上下文」丨对话flomo浮墨笔记

量子位智库对话flomo浮墨笔记联合创始人刘少楠,探讨AI笔记产品发展。刘少楠分享了flomo定位、目标人群、降低门槛方法等,提及AI带来的认知变化,还谈了产品指标、功能考量、成本平衡等问题。

量子位
算法论文8

腾讯提出“我思故我玩”Agent:LLM构建推理与规划世界模型

腾讯与武大联合发表论文提出 CEL 新型 Agent 架构,通过 LLM 驱动两阶段循环实现“思考式学习”。它能填补传统方法短板,在小游戏实验中表现出色,有可解释性等优势,但也有实验环境局限等问题。

深度学习自然语言处理
算法论文8

PRSA 2025 | RPI Nithin Somasekharan、Shaowu Pan(潘韶武):突破柯尔莫哥洛夫屏障——面向模型降阶的可学习加权混合自编码器

本文将线性POD与非线性Autoencoder通过可学习参数融合,提出可学习加权混合自编码器架构。在多数据集验证中,该方法克服了POD和纯AE的局限,在复杂PDE系统预测中表现出色,或可降低大规模计算成本。

力学与人工智能
开源动态7

Karpathy用「harness」彻底终结了RAG。

假期时Karpathy提出llm.wiki想法引发关注。它是元框架,定义人类与AI协作管理知识的方式。与RAG不同,它将新材料关键信息编入已有wiki并持续维护。作者用多种数据测试,发现TextIn API解析效果好,还优化处理流程提升质量。

探索AGI
算法论文7

JCP | 浙江大学边鑫等:基于 PINNs 的非结构自适应网格细化:面向稳态流动的残差驱动 AMR 新方法

本文提出利用控制方程残差引导网格细化的启发式策略,用物理信息神经网络(PINNs)整合粗网格数据与控制方程。通过解决流动问题并与传统方法对比,显示该策略能平衡计算精度与成本,但有额外计算开销。

力学与人工智能
推荐文章7

200行python代码实现从Bigram模型到LLM

本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。

阿里云开发者
算法论文8

首次披露!DeepSeek V3 发布软硬一体协同训练论文,公开「降成本」秘诀

DeepSeek团队发布论文《洞察DeepSeek - V3:规模的挑战和对AI架构硬件的思考》,从硬件架构和模型设计双重视角,探索其经济高效的大规模训练和推理方法,介绍了设计原则、低精度驱动等多方面内容及降成本秘诀。

AI科技评论
新闻资讯7

OpenAI新模型Day0就被嫌弃!排名拉垮,不如一月底发布的国产模型

OpenAI推出GPT - 5.4 mini和nano模型,主打快速经济,针对编程等优化。但评测中GPT - 5.4 mini排名不佳,不如国产Kimi 2.5,且价格对比有争议。不过与自家旧版比有提升,网友测试有亮点。

量子位