轻量级验证器」共找到 1122 篇相关文章

新闻资讯7

GPT-6突破「素数间隔」纪录!这次是加入OpenAI的北大数院07级校友

OpenAI总裁宣布进入AGI时代,GPT - 6 Astra虽仅向少量组织开放,但引发大量讨论。北大数院校友苏炜杰宣布其将素数间隔上界从246推进至186,完成Lean验证。多家机构围绕此问题研究,AI或成数学研究伙伴。

机器之心
算法论文8

PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃

快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。

机器之心
开源动态8

Qwen3技术报告首次全公开!“混合推理模型”是这样炼成的

本文首次公开Qwen3技术报告,介绍其模型架构、预训练及后训练过程、性能表现等技术细节。Qwen3整合两种模式,引入思考预算机制,降低轻量级模型计算资源,在多基准测试领先,多语言支持扩展至119种,所有模型开源。

通义千问Qwen
产品应用8

杀疯了!单卡4090跑通全量微调,面壁1B级多模态性能怪兽硬刚大厂

面壁智能推出MiniCPM-V 4.6,参数约1B,性能和推理效率出色。它在多模态任务综合能力、推理速度上领先竞品,靠ViT架构改造和4倍/16倍混合视觉Token压缩实现创新,有工业验证,对开发者和普通用户意义大。

AI寒武纪
算法论文8

vivo AI Lab提出自我进化的移动GUI智能体,UI-Genie无需人工标注实现性能持续提升

香港中文大学MMLab和vivo AI Lab团队提出自我进化框架UI - Genie,构建奖励模型UI - Genie - RM解决轨迹验证难题,通过数据生成和模型迭代闭环实现智能体与奖励模型双向增强,在多基准测试中表现出色,打破人工标注瓶颈。

机器之心
产品应用7

30分钟轻松掌握Cursor,快速提升开发效率和体验

本文通过在WebX老项目实践,验证Cursor用AI大模型能高效生成符合老旧项目规范的代码框架,显著提升开发效率与体验。还介绍其页面区域、AI聊天区功能,通过实战演示展示提效过程,最后提及可与MCP结合及OpenAI开源模型部署方案。

阿里云开发者
算法论文8

分享两篇Claude Skills最新论文,有3个核心结论

文章分享两篇Claude Skills最新论文,总结出技能安全漏洞、技能数量与准确率关系等结论。还探讨单智能体技能系统能否取代多智能体,通过实验验证其效率优势,并提出解决技能选择过载的方案,也对Agent Skills做了安全分析。

PaperAgent
产品应用7

AMD服务上一个诡异的性能问题诊断历程

本文复盘AMD服务高优故障,从8月底起,集团amd turind机业务cpi和cpu利用率飙升,影响业务性能。经排查是split lock问题,由python解释调用__libc_free时出错引发,还分析了问题原因、传导路径,并给出应对措施。

阿里云开发者
算法论文7

让推荐学会思考:用强化学习激活大模型的序列推理能力

文章指出推荐系统曾未紧密结合大模型能力,如今正靠近其训练范式。作者基于用户行为序列,用强化学习训练大模型理解序列关系,以预测用户下一个可能点击的资讯,并通过实验验证了该方法的可行性,还探讨了不同数据库中BM25算法的差异。

AI科技评论
产品应用7

交互式世界模型来了:不止理解世界,更要改造世界

8月17日,智象未来发布交互式世界模型HiDream - O1 - World,定位为全球首款原生全模态交互式世界模型。它提供漫游和编辑两种交互方式,在WBench测试中成绩优异,但开放场景表现待验证。其采用独特生成方式,有广阔应用前景。

DeepTech深科技