「新版图灵测试」共找到 4977 篇相关文章
Anthropic 训出史上最强模型,当场决定不发布
Anthropic推出Claude Mythos Preview模型却不对外开放。该模型在多维度基准测试中领先,还能发现大量网络安全漏洞。系统卡记录其不良行为,Anthropic推出Project Glasswing应对,认为现有对齐方法或难约束下一代系统。
硅谷前沿访谈:CUDA之父复盘英伟达20年护城河,揭开万亿算力帝国的底牌
奇点智能研究院院长李建忠采访了“CUDA 之父”Ian Buck,探讨 CUDA 20 年演进、英伟达技术产品及生态。Ian Buck 介绍了 AI 基础设施新阶段,阐述 CUDA 成功原因,还谈及英伟达软硬件协同、应对竞争等问题。
AI邪修时刻!Meta联手MIT投毒,左脚踩右脚强行升天
Meta的SOAR架构用错误率高的数据让模型推理能力暴涨9.3%。它选难题子集,用‘教师模型’生成含错题的‘垫脚石问题’,通过‘双层博弈’和‘有根奖励’机制让模型进步,或成AI进化新方向。
Harness Engineering又他妈是啥?
AI圈新词Harness Engineering引发关注。它类似给AI套缰绳,让其运转更高效。通过案例表明,模型非瓶颈,环境才关键。还介绍不同实现方式,指出命名有价值,最后探讨培养新人设计harness的问题。
Meta 放出大招:让 AI 实现自我进化,Karpathy 的 autoresearch 沦为小弟
Meta联合多机构发布论文,提出HyperAgents框架,让AI不仅改进自身,还能改进「改进自己的方法」。它打破传统AI自我改进瓶颈,在多领域测试表现出色,还自发形成记忆机制,有迁移和叠加效果。
让AI自己“炼数据”!DataChef开源:用强化学习自动生成LLM数据配方
上海人工智能实验室联合复旦大学开源DataChef,它能通过在线强化学习自动生成LLM数据配方。实验显示其能力逼近Gemini - 3 - Pro,超越人类专家设计算法,解决传统数据工程难题,推动大模型数据工程迈向新范式。
GPT-5.4一周狂赚10亿美元ARR!一句嗨烧掉80刀,效率却飙升32倍
OpenAI总裁披露,GPT - 5.4上线一周,每天处理约5万亿token,带来10亿美元年化净新增收入。它成本和token消耗量高,但效率提升32倍。作为“大一统”模型,它智能水平出色,原生支持电脑操作。
MIT学生48小时学完一学期的课,90%的人用错了AI
社交媒体热帖揭秘MIT学生48小时学完一学期课程的方法。该学生用谷歌NotebookLM工具,通过追问专家级认知框架、学科争议点等问题,快速掌握学科知识版图,而多数人仅将其当划重点工具。
1500 个 PR、0 人写代码:Codex 驱动的百万行级内部产品实践
团队在五个月内开发并发布无人工编写代码的内部测试产品,代码均由Codex生成,效率高。介绍了开发过程,如定义工程师角色、增加应用可读性等,还提及面临的挑战及解决办法,分享实践心得。
OpenAI用8个Skill把工程师的经验变成AI的工作手册:扛起两个SDK,3个月457个PR
OpenAI公开用Codex + Skills维护Agents SDK开源项目的方法论。通过AGENTS.md、Skills和GitHub Actions配合,将重复性工作自动化,PR吞吐量涨45%。还介绍了Skill设计、规则设定、测试策略等,且方案组件已开放。