代码验证」共找到 2401 篇相关文章

开源动态8

当大模型陷入幻觉循环,如何用工程化给它“立规矩”?

普林斯顿和伯克利研究定义“机器胡扯”,指出大模型胡扯问题。蚂蚁集团旗下蚂蚁密算在2025 WAIC提出高阶程序(HOP)框架,为大模型注入规则,还开源此框架,其在多行业场景应用效果良好。

InfoQ
产品应用8

全新 AI 消息模型:Apache RocketMQ 如何让 AI 应用拥抱事件驱动架构?

AIGC浪潮下,大语言模型重塑应用开发范式,开发者构建AI应用面临诸多挑战,需可靠高效的异步通信机制。Apache RocketMQ在AI时代演进,有轻量化通信与智能化资源调度两大创新,还介绍了多场景实践。

InfoQ
算法论文8

推理速度飙升5倍,苹果提出全新Multi-Token生成框架!

自回归语言模型逐词生成文本拖慢推理速度、限制并行能力。Apple提出全新框架,挖掘其对未来词元“先验知识”,通过多项技术并行预测多词元,微调预训练模型可显著提速且不损输出质量。

PaperAgent
推荐文章7

如何利用pytorch memory snapshot进行显存分析

文章聚焦于用pytorch memory snapshot分析模型训推显存消耗,不讨论工具使用,侧重解读记录内容。以混合精度训练为例,介绍各步骤显存管理细节,还给出单层、双层模型及zero1训练的显存分析。

GiantPandaLLM
算法论文7

现代GPU体系结构Cache Operators行为研究

本文基于Compute Capability 8.9的L20 GPU进行实验,对NVIDIA PTX Cache Operators行为做进一步探究,验证了STG指令命中L1 Cache时执行Write Through等结论,还提出了遗留问题待解决。

GiantPandaLLM
产品应用8

ChatGTP 发布 Agent 了,但我更推荐 MiniMax

作者受邀内测 MiniMax Agent 新功能,体验用其搭建 AI 资讯聚合网站,无需写代码,两小时搞定。该产品全栈开发功能强大,有 MCP 生态,多模态能力出色,对比 ChatGPT Agent 更具优势。

MacTalk
算法论文8

一个标点就能迷惑LLM-as-a-Judge!

论文揭露惊人漏洞,一个标点或通用推理开场白就能欺骗最先进的LLM裁判,导致强化学习训练崩溃。研究通过实验验证漏洞,提出Master - RM模型,其FPR近乎0%且保持通用裁判能力。

深度学习自然语言处理
算法论文7

只因一个“:”,大模型全军覆没

一篇论文发现冒号等符号、“Thought process:”等语句能欺骗LLM,让虚假回答通过。实验表明所有测试模型都会触发假阳性响应。研究人员构建新“评委”模型Master - RM,可让假阳性率接近0%。

量子位
推荐文章8

吴恩达老师分享的做 MVP(最简可行产品,minimum viable product) 的技巧

吴恩达分享做MVP技巧,建议时间有限时缩减项目范围,如一小时内借助代码助手做小部分。他以做虚拟观众模拟器为例,说明此方法能推动项目、收集反馈,让创意快速落地。

宝玉AI
算法论文8

JCP | 哈工大(深圳)胡钢团队:三维钝体流动中主动流动控制的深度强化跨域迁移学习

本文将基于相互信息的知识迁移学习与柔性动作 - 评论(MIKT - SAC)算法结合,解决主动流动控制中状态和动作维度的跨领域问题。应用于两个测试案例,结果显示该方法优于SAC算法,能显著减少训练时间、降低阻力系数。

力学与人工智能