跑分造假」共找到 844 篇相关文章

算法论文8

突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!

近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变问题形成自我提升循环,实验效果惊人。

深度学习自然语言处理
算法论文8

比RAG高出8.9%,百度TURA:让搜索引擎“动”起来的下一代AI Agent架构

现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户需实时数据的问题。百度TURA用工具调用把RAG升级为动态交互,其核心检索、规划、执行三步,已在百度亿级流量场景通。

PaperAgent
产品应用8

AI发布首个全球科学家社区爆火,硅谷投资圈:科技研究领域的「谷歌地图」来了!

O-DataMap,由AI论论全球打造的全球科学家社区爆火,被赞为科技研究领域的「谷歌地图」。它将全球论文实验数据整合到二维坐标系,形成动态「科技地图」,还三层助力科研决策,本月18号论论全球将直播演讲。

机器之心
推荐文章8

Devin 教你做 Agent:把 AI 当做需要指导的初级开发者

Cognition团队发布编程智能体实践指南,以把AI当初级开发者的心智模型为基础。介绍与智能体沟通原则及融入日常工作流的场景,还初、中、高级给出任务处理方法,也提及局限性、使用建议和安全管理等内容。

Founder Park
新闻资讯7

机器人整机是“有限游戏”?对话星海图创始人:具身智能商业化的三个阶段,终点是卖Token

星海图CEO高继扬等提出具身智能三重跃迁,发布新模型并开源,首秀自研机器人。公司从整机起步,联合建数据公司,规划数据量。其商业模式三阶段,认为中国具身基础模型能力有望超美。

AI前线
7

华为盘古大模型:被芯片牵制的“千古”模型

华为盘古大模型团队员工自曝内幕,称其受芯片限制,早期算力有限、训练困难。还指出内部存在造假、套壳等问题,如135B V2套壳Qwen 1.5 110B,pangu pro moe 72B套壳qwen 2.5的14b等,导致人才流失。

Agent的潜意识
产品应用7

Seedance 2.5 抽卡老废片?专业团队的 4 层控制法

Seedance 2.5上线后,单条画质好但成片易散架,废片率高。文章将官方提示词指南和一线镜写法整合成四层控制框架,还给出30秒短剧镜示例,助你定位问题、提高抽卡效率。

AI Reading Hub
新闻资讯7

豆包要收费了:三档订阅最贵500元/月,保留免费基础版

五一假期时,豆包要收费的消息冲上热搜。苹果App Store已现订阅服务声明,三档,最贵500元/月,目前仅测试,正式上线会发完整信息,且保留免费版。豆包APP日活、用户新增和规模都断层领先。

量子位
产品应用7

互联网黑话之西游记版 AI 视频的制作方法

文章介绍互联网黑话之西游记版AI视频制作方法。先与AI共创剧本,以互联网黑话结合西游记场景为佳;再让AI根据剧本和人物形象图生成包含多内容的镜脚本,生成首帧图后按脚本制作视频,不满意可反复生成再拼接。

宝玉AI
算法论文8

Dense、MoE之外第三条Scaling路径:交大提出JTok模块,省1/3算力

上海交通大学与小红书Hi Lab联合团队提出JTok/JTok - M模块,作为插件挂载在Transformer层,几乎不增算力和显存开销却显著提升性能。该模块构建新scaling路径,在多任务测试中全面提,为大模型发展提供新方向。

机器之心