「AB 实验平台」共找到 2601 篇相关文章
A16Z发布最新AI应用榜单,中国产品强势崛起
a16z发布第五期消费级AI应用排行榜,此榜单已成观察AI日常使用趋势的重要指标。新面孔减少,生态趋于稳定。Google发力,多个产品入榜;Grok表现佳,Meta AI欠佳;中国产品崛起,多个上榜;‘Vibe Coding’平台带动其他工具增长。
比起让大模型写 100 万字的小说,AI 大牛们更想用 AI 拿诺贝尔奖
OpenAI前CPO Kevin Weil创业,新公司定位是“为AI模型收集科学数据”的平台,估值达7.5亿美元。AI4S赛道成为硅谷离职AI高管热门去向,正从概念叙事进入基础设施建设阶段,包括数据、模型、应用层。
【DeepSeek-OCR系列第一篇】Language Modelling with Pixels【ICLR23】
当前主流语言模型依赖固定词表,扩展到多语言、多脚本时面临覆盖受限、计算昂贵、鲁棒性差等问题。ICLR 2023论文提出不依赖词表的PIXEL模型,通过将文本变成图像用视觉Transformer理解,实验验证其有跨语言、抗噪声等优势。
一种基于滑动层合并的高效深度修剪大模型的方法
文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。
Agentic 应用时代,Dify 全链路可观测最佳实践
文章讲述 Dify 平台在 Agentic 应用开发的可观测性挑战,从开发者与运维方视角分析现状、局限与改进方向。云监控推出全景可观测方案,还介绍各组件监控接入步骤及实践指南,最后提及 Qwen - Image 生图优势。
告别 260 亿美元的低效投入,HappyRobot 为物流业配置 “AI 调度员”
HappyRobot为物流市场搭建AI-native平台,切入“voice agent + 通信自动化”领域,打造“数字员工”。它能提升沟通效率、降低成本,已获6200万美元融资,还尝试拓展至其他行业。不过,也面临AI价值兑现不对称等潜在风险。
DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO
文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。
对噢!为什么LMs就不能直接输出答案+confidence呢?
当前语言模型在复杂问答任务中存在校准退化问题,本文提出RLCR方法,将概率校准融入RL训练目标,重构奖励函数,在多个数据集实验中显著降低校准误差,不损失准确性,为高风险场景AI部署奠基。
英伟达祭出NVFP4核弹:大模型训练根本性转变,GB300效率狂飙7倍
英伟达推出新格式NVFP4,能以4 - Bit速度与效率实现16 - Bit生产件级训练精度,是LLM开发重大飞跃。虽处于研究阶段,但正与多组织合作。还介绍其方法、优势,实验也证明它在大规模训练的有效性。
Reasoning的最终答案可能不是模型想要的答案!
大型语言模型解决复杂问题有推理过程和答案,传统评估只看最终答案。论文提出最终答案可能不佳,中间步骤更值得研究。还介绍通过切割推理过程发现中间步骤藏玄机,提出‘分步检查法’提升模型表现,实验表明准确率最高提升13%等。