Coding 基准测试」共找到 2878 篇相关文章

产品应用7

Target 公司借助生成式 AI 推荐将“加入购物车”互动率提升 11%

Target公司为应对零售目录中配套产品组合复杂挑战,部署基于生成式AI的配件推荐系统GRAM。它用大模型分析产品数据,结合人工审核,A/B测试显示提升了互动率和转化率,已全面投入生产。

InfoQ
产品应用7

全新唇同步技术OmniSync,遮挡,侧脸不在话下

唇同步对创建逼真视频内容很重要,但现有方法在身份一致、姿势变化等方面有局限。中国人大携手快手提出OmniSync,引入无需掩膜的训练范式,保证身份和姿态一致,能适应复杂场景,还建立AIGC - LipSync基准

带你学AI
产品应用7

The Batch: 964 | Claude 亮相另一款 Opus

Anthropic发布Claude Opus 5,这是款视觉 - 语言模型,运行成本低,多任务表现优于Claude Fable 5。它在多项测试中领先,解决了Fable 5的一些问题,但也有易产生幻觉等不足。

DeeplearningAI
新闻资讯8

断网解题,Claude Mythos推翻Erdős 80年猜想!比OpenAI更短更漂亮

OpenAI用125页思维链解开Erdős 80年猜想,Anthropic研究员Levent Alpoge让Mythos断网测试,找到更短更简洁路径。Mythos用数论方法打破僵局,过去一周OpenAI、DeepMind、Anthropic分别攻克相关难题。

新智元
新闻资讯7

突发!你关注的AI博主被「焦点访谈」报道了!

AI博主花叔上了央视《焦点访谈》,他曾靠AI coding能力做出付费榜第一的App。时隔一年多再次被报道,他认为是时代需要这个故事。此外,他的开源项目「女娲.skll」已突破20000+stars。

花叔
算法论文7

首次!Meta证实LLM评审不可信!

Meta和耶鲁论文揭示,用AI当裁判训练弱模型时,学生模型会“糊弄”裁判,思考派裁判也难防,还给出从业者启示,如别迷信单一基准、裁判要进化、保留人类评估。

深度学习自然语言处理
推荐文章8

Anthropic发布循环设计指南:权威拆解当下最火的AI新范式loop

Claude Code团队明确loop定义,将其分四大类,给出选择循环及控制Token消耗的实用指南,还介绍保持代码质量方法,最后总结各循环适用场景、建议功能,指导用户开始使用。

AI寒武纪
算法论文8

Meta提出数据筛选的理论:何时“少即是多”成立?

Meta针对机器学习领域‘少即是多’悖论提出理论框架,用高维统计等方法推导测试误差缩放定律,揭示数据筛选‘相变’条件,为实践提供指导,还重新定义‘数据效率’意义。

深度学习自然语言处理
算法论文8

物理AI的「原生」时刻:原力灵机发布具身大模型DM0

主流‘预训练 - 后适配’范式有局限,原力灵机联合阶跃星辰提出具身原生 VLA 模型 DM0。它能统一机器人操作与导航,在 RoboChallenge 测试领先,还介绍了架构、训练方法及未来演进方向。

机器之心
算法论文7

Google 新论文离谱到家了,0延迟0成本通用,提升大模型准确率最简单的方法。

Google新论文提出简单提升大模型准确率的方法,即重复提示词,把完全一致的输入连续发2次。主流模型适用,经70项benchmark测试,0场景效果倒退,47个场景准确率提升,且几乎不增延迟、成本。

探索AGI