「AI4E」共找到 10524 篇相关文章
GPT-5编程成绩有猫腻!自删23道测试题,关键基准还是自己提的
有人发现OpenAI测试GPT-5编程能力时,用的SWE-bench Verified子集仅477题,自行省略23题。若这些题默认零分,其得分比Claude Opus 4.1低。且该基准还是OpenAI自己提出的。
开放世界任务成功率82%!美的攻克机器人泛化控制难题
美的AI研究院和华东师范大学联合提出ChatVLA - 2模型,引入动态混合专家架构和双阶段训练流程。真机实验显示其开放世界任务成功率达82%,远超现有方法,为通用机器人控制提供新思路。
伯克利最强代码Agent屠榜SWE-Bench!用Scaling RL打造,配方全公开
开源软件工程模型DeepSWE横空出世,基于Qwen3 - 32B,仅用强化学习训练,以59%准确率刷新SOTA。它采用rLLM框架、R2E - Gym环境,用改良GRPO++算法,还介绍了评估策略及训练挑战的解决办法。
深入解析|Cursor编程实践经验分享
文章结合近两个月实践,分享Cursor编程经验,探讨其适用场景与问题。介绍使用方法,如标准Prompt、Rules等,还提及MCP工具及Cursor不足,对比DeepResearch等平台,最后介绍AutoGPT、Claude4.0等技术。
华为昇腾推理对决:开源vLLM vs 官方MindIE,数据说话「Qwen与DeepSeek推理实测」
文章围绕华为昇腾推理,对比开源vLLM与官方MindIE。借助GPUStack平台测试Qwen与DeepSeek模型,分析不同场景性能。指出vLLM和MindIE各有优势,还强调构建国产AI推理生态需多要素,鼓励开源协作。
豆包 1.6发布后,我用火山引擎Trae + MCP,仅半天做了一个“秒懂科研”的PaperAgent!
文章介绍用火山引擎Trae + MCP和豆包1.6构建“秒懂科研”的PaperAgent。对比其与传统开发范式,突出前者高效、低成本优势,还展示了PaperAgent技术栈及开发过程,体现AI云原生开发魅力。
这个项目专治建模手残党,给张图就能转变可编辑能转动的3D模型
img2threejs上线11天获4.8k Star,专治建模手残党。给它一张图,它让AI写代码把物体“搭”出来,不重建几何,也不下素材包,还省Token、零依赖,有严格质量门控。
Supabase:百亿美元估值,vibe coding 的默认后端?
Supabase 以 Postgres 为核心,提供一站式后端服务,接近完成 5 亿美元 F 轮融资,估值 100 亿美元。它处于 Postgres 生态和 AI coding 趋势交叉点,产品路线图向 agent 倾斜,面临竞争、UE 等挑战。
永别了,背公式时代!波兰物理学家用一个算子统一数学
2026年4月,波兰雅盖隆大学物理学家安杰伊·奥德尔齐沃莱克发表论文,提出算子eml(x,y) = eˣ − ln(y),证明不断嵌套此算子可推导出科学计算器上每个按键对应的函数,引发数学界震动。
从工具到生命形式:OpenClaw 引发的 Agent 再思考
InfoQ《极客有约》X QCon 直播聚焦 OpenClaw 落地难点。嘉宾探讨其验证的价值、生产级形态、落地难题等,还谈及 AI 与人类共生关系、记忆系统问题及解决方案,最后分享企业落地经验和会议信息。