可观测2.0」共找到 5880 篇相关文章

算法论文8

拒绝Reward Hacking!港科联合快手灵提出高效强化学习后训练扩散模型新范式

使用强化学习微调扩散模型时,常面临Reward Hacking和KL正则化阻碍探索收敛的问题。港科等团队提出GARDO框架,通过门控自适应正则化和多样性感知优化,解决痛点且全面开源。

机器之心
开源动态8

18.2K Star!macOS 丝滑跑Linux,一键容器、多架构支持,开发效率直接起飞!

介绍轻量级虚拟机管理器 `Lima`,它能在 macOS 上提供类似 WSL2 的体验,专注容器化工作流。支持多架构与多驱动,有开箱即用的容器化支持等特性,安装和使用简单。

开源先锋
产品应用7

OpenCode AI编程实践:利用推理路由低成本开发游戏

文章介绍用 OpenCode 结合 DigitalOcean 推理路由器开发点球大战游戏 PK Shootout。其按任务选模型,多数任务路由到 MiMo V2.5 和 GLM - 5.2,成本约 8.25 美元,远低于只用前沿模型。文中还分析开发各环节及适用场景。

AI工程化
算法论文8

0人工参与实现梯度更新!MIT新框架让AI自动生成微调数据,权重自主升级

MIT提出新强化学习框架SEAL,让模型生成微调数据和自我更新指令,实现权重更新。无需人工,模型能自动梯度更新。经知识注入和小样本学习实验验证效果,还介绍了其双循环工作机制。

量子位
开源动态8

阿里发布信息检索Agent,自主上网查资料,GAIA基准超越GPT-4o | 模型&数据开源

阿里发布WebDancer信息检索Agent,能自主上网查资料。它具备多步推理等能力,采用四阶段训练范式,模型和方法已开源。在多个基准测试中表现优异,突显处理复杂任务的鲁棒性和有效性。

量子位
产品应用8

美团提出全新多模态统一大模型STAR,GenEval突破0.91,破解“理解-生成”零和困局

近日美团推出多模态统一大模型 STAR,以“堆叠自回归架构 + 任务递进训练”实现理解与生成双重突破。它解决行业痛点,通过三大核心设计统一能力,实验在多任务中表现顶尖,还给出后续探索方向。

机器之心
开源动态8

5.2K Star!离线也能翻译,零网络高隐私,40+语言的纯本地翻译神器!

日常在线翻译服务有隐私、离线使用等问题,Argos Translate是100%本地运行的离线翻译方案,免费、隐私安全,支持40多种语言,具备多模态接口、GPU加速等功能,适合多种场景。

开源星探
算法论文8

腾讯发布大模型思考早停算法SpecExit,效果无损,端到端加速2.5倍!

腾讯为破解大模型长思维链效率难题,提出思考早停算法SpecExit,将思考早停与投机采样融合,在不影响准确性前提下,在vLLM上实现端到端加速2.5倍,还能缩短思维链长度。

腾讯技术工程
新闻资讯8

前沿模型被曝年度重大漏洞:加密思维链被轻松提取,GPT,Claude,Gemini 无一幸免

一篇 116 页论文揭示前沿模型思维链重大安全漏洞,Anthropic、OpenAI、Google 的 API 因架构问题,模型隐藏推理过程通过两次 API 调用被大规模提取,还会带来多种安全威胁。

AGI Hunt
推荐文章7

分享2个模型省钱大法

文章分享两个大模型API省钱技巧。一是文本转截图,适用于输入长输出短、费用花在输入token的任务;二是音频加速识别,OpenAI语音识别模型Whisper按音频时长收费,加速音频省钱,还包装成API服务盈利。

AGI Hunt