「可验证过程奖励」共找到 1293 篇相关文章
玻璃封装大热,TGV还有多少难题待解?
先进封装成后摩尔时代芯片算力提升关键,玻璃基板封装受关注,但仍处验证阶段。TGV技术成熟度是玻璃基板技术破局点,国内部分企业有突破,不过玻璃材料物理特性制约其普及。
一举击败Claude Code!微软提出代码生成黑科技:一键直出36K行代码
现有方法依赖自然语言规划生成仓库易失效,微软提出Repository Planning Graph (RPG),以图谱替代文字规划。基于此的ZeroRepo框架能让仓库生成可控、可扩、可验证,在新基准RepoCraft上表现远超Claude Code。
马斯克新模型背后算法来自英伟达???
Grok-4-fast降本增效表现出色,其背后或许关联英伟达算法论文。论文推出Jet-Nemotron模型,靠PortNAS框架降本提效,还开源代码。网友猜测Grok-4-fast基于此模型,也有人认为是营销手段。
Pogocache:开源缓存软件实现低延迟并支持多传输协议
全新开源缓存软件 Pogocache 近日发布 1.0 正式版,主打低延迟与 CPU 高效能特性,支持多种主流通信协议,宣称比其他开源缓存方案有更高吞吐量和更低延迟。还介绍了其架构、应用场景等。
EMNLP2025 | LLM多次回答一致就一定正确吗?非也
随着LLMs在高风险领域广泛应用,其输出的事实性错误引发安全质疑。中科院计算所和美团团队论文揭示自我一致错误,传统检测方法对此失效,提出跨模型探针法提升检测能力。
推理路径的动态调控:让大模型学会“恰到好处”的思考
当前大模型推理路径存在冗余问题,本文提出测试时提示干预框架PI(π),通过《When/How/Which》三模块协同,将人类专家经验融入推理过程,在多个STEM基准测试中缩减推理步骤、提升准确率。
微软开源2025 ICML获奖框架,终结大模型多轮对话严重缺陷
微软开源2025年ICML获奖框架CoLLabLLM,可解决大模型多轮对话缺陷。它由四大模块构成,经多轮对话模拟和奖励优化模型。在三大基准平台测试显示,能在多样任务中高效协作。
看遍奥斯卡后,VLM达到电影摄影理解新SOTA|上海AI Lab开源
上海人工智能实验室等推出ShotBench、ShotVL及ShotQA,ShotBench含超3.5k问答对,ShotQA约7万个问答对。ShotVL在ShotBench评测中表现出色,3B参数的ShotVL-3B增益达19.0%,超越GPT - 4o等。
一篇被证明“理论有误”的论文,拿下了ICML2025时间检验奖
2015年发表的Batch Normalization论文在ICML 2025会议获时间检验奖。它引用超6万次,推动了深层神经网络发展。虽2018年被指理论有误,但仍有新研究发现其对训练过程的根本影响。
对话 Ruby on Rails 之父:发自内心恨透 Copilot,手凿代码才是程序员的乐趣
传奇程序员 DHH 做客播客,深入探讨世界观。他虽用 AI 学习,但担忧 AI 编程助手致技能退化,‘恨透’它。还谈及编程经历、语言看法、架构偏好、商业哲学等,观点鲜明,引发关注。