优化原理」共找到 1416 篇相关文章

算法论文8

推理时间减少70%!前馈3DGS「压缩神器」来了,浙大Monash联合出品

在AR、VR等领域,3DGS是新视角合成(NVS)领域备受关注的技术方案。现有前馈3DGS模型存在编码器容量有限等问题,ZIP Lab和Monash团队引入信息瓶颈原理,推出轻量级模块ZPressor,有效解决信息过载难题。

量子位
推荐文章7

200行python代码实现从Bigram模型到LLM

本文从`babygpt_v1.py`出发,逐步加入self-attention机制、position嵌入等,实现完整GPT。介绍Transformer结构,讲解位置编码、单头自注意力等机制的代码实现,还阐述后续层的用途、参数调整及训练效果,最后提及模型优化方向。

阿里云开发者
新闻资讯7

OpenAI新模型Day0就被嫌弃!排名拉垮,不如一月底发布的国产模型

OpenAI推出GPT - 5.4 mini和nano模型,主打快速经济,针对编程等优化。但评测中GPT - 5.4 mini排名不佳,不如国产Kimi 2.5,且价格对比有争议。不过与自家旧版比有提升,网友测试有亮点。

量子位
产品应用8

震惊海外开发者!BOSS直聘3B小模型比肩80B,怎么做到的?

BOSS直聘楠北阁团队发布3B轻量端侧小模型Nanbeige4.1-3B,性能震惊海外开发者。团队从多方面改进,如优化推理和偏好对齐,重构训练数据,采用多种强化学习算法,使其性能比肩大模型。

AIGC开放社区
新闻资讯7

GPT-5准确率不足40%!北大发布多模态、高难度化学基准SUPERChem

北大团队发布多模态、高难度化学基准SUPERChem,构建评估大语言模型化学推理能力新体系。测试显示,GPT - 5准确率仅38.5%,与低年级本科生相当,且模型在高阶推理有短板,该基准为模型优化指明方向。

新智元
新闻资讯7

阿里AgentBay揭秘,Agent Infra才是真护城河!

在云栖大会上,阿里云无影宣布Agent基础设施AgentBay重大升级,展示全新个人计算产品。它有完善能力,可调用云上资源。文章还阐述了Agent Infra的必要性、进化体现及成本优势,指出优化环境很重要。

探索AGI
新闻资讯7

Anthropic CEO:模型可在一亿上下文窗口中学习,且不改变权重,未来AI将每月10万美元

Anthropic CEO Dario Amodei预测几年内将出现月费10万美元、支持1亿词上下文窗口的AI模型。Google Research论文揭示LLM能在不改变权重下,通过「临时便签」机制学习,还介绍了其原理与实验验证。

AGI Hunt
开源动态8

图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成

Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。

量子位
开源动态8

Python逆天改命!开源Hermes首次击败OpenAI Codex

纯Python写的开源项目Hermes Agent,在11项基准测试中以6:5战绩击败OpenAI用Rust写的Codex。它通过三大工程优化,将启动时间从701ms降至258ms。这表明在AI Agent领域,架构比语言性能更重要。

新智元
新闻资讯7

全国首部AI智能体应用评估标准,现公开征集起草单位和个人

随着大模型热潮进入深水区,企业急需业务智能体,但因缺乏可量化评估标准,AI智能体应用面临选型、验收、优化困境。智合标准中心发起《企业级AI智能体应用效能评估规范》团体标准起草工作,现公开征集起草单位和个人。

开源先锋