「AI研究架构调整」共找到 11373 篇相关文章
专业医生远不如AI模型?OpenAI推出医疗开源测试基准HealthBench,o3表现最强
OpenAI推出医疗开源测试基准HealthBench,由262位多国医生合作打造,含5000段真实健康对话。评估显示o3综合表现最佳,顶尖AI处理任务能力超无辅助医生,HealthBench更真实专业有区分度,但也有局限。
北大腾讯突破奖励模型瓶颈!让AI理解人类偏好,泛化能力比肩GPT-4.1
北京大学知识计算实验室联合腾讯等机构提出RewardAnything,突破奖励模型瓶颈。它让奖励模型理解自然语言评判原则,降低成本,泛化能力比肩GPT - 4.1,还能用于定制AI行为模式。
DeepSeek V3.1 领衔,万字长文CodeBuddy AI Coding 企业落地实践思考
文章结合腾讯CodeBuddy IDE工具,为企业AI CODING落地提供指南。先诊断团队研发流程痛点,给出解决思路;介绍选择AI CODING工具的考量因素及CodeBuddy特色;阐述落地实践问题与应对,构建工作流,还提及使用价值、心得、产品思考与未来展望。
三大头部互联网企业交锋,AI时代可观测边界出现了吗?
InfoQ《极客有约》X AICon 直播栏目邀阿里云张城等探讨AI时代可观测新边界。嘉宾们认为AI与可观测技术双向赋能,传统算法与大模型互补,未来有望实现半自治运维,还分享了数据治理等经验。
菲尔兹奖得主都栽了!Claude终结78年悬案,或成最重要AI数学成果
78年数学难题“六维球面上有无复结构”被哈佛数学家Levent Alpöge和Claude解决,他们绕开老路造出答案,还给出108页论证,数学家挑不出毛病。Alpöge在35天内三次用AI破难题,这次性质不同,是模型创造新对象。
刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分
Meta联合斯坦福、哈佛推出ProgramBench测试,200个项目从零手写,9大顶级模型完整通过率0%。该测试与SWE - Bench不同,考AI自主设计软件能力,还发现模型代码风格异于人类,联网时部分模型作弊。
TPAMI 2025 | AI对抗迁移性评估的「拨乱反正」:那些年效果虚高的攻防算法们
本文第一作者赵正宇来自西安交大,针对现有迁移攻击方法缺乏系统公平对比分析的问题,将其分为五大类,在 ImageNet 上对 23 种攻击与 11 种防御方法开展评估,证实评估缺陷会误导结论,解决后有新见解。
王炸!模型越接越乱,2.9 万 Star OmniRoute 把 290+ 个 AI 供应商压成一个入口
现在接入AI工具麻烦,换模型要改配置,额度、接口等也有问题。OmniRoute是开源AI Gateway,将多家模型供应商统一到一个入口,支持290+ providers等,可解决接入混乱问题。
抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10
传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。
3亿美金种子轮!ChatGPT大神联手DeepMind牛人,要造一个真正的“AI科学家”
9月30日,OpenAI的ChatGPT创造者之一William Fedus和谷歌DeepMind的GNoME项目负责人Ekin Dogus Cubuk成立Periodic Labs,获3亿美元种子轮融资。公司要创造“AI科学家”和自主实验室,从物理科学切入,解决超导、半导体等领域问题。