「AGI测试」共找到 2161 篇相关文章
对标GPT-4o和香蕉!浙大开源ContextGen:布局身份协同新SOTA
浙江大学ReLER团队开源ContextGen框架,攻克多实例图像生成中布局与身份协同控制难题。基于Diffusion Transformer架构,用双重注意力机制实现布局精准锚定与身份高保真隔离,在基准测试中超越开源SOTA模型,对标GPT - 4o等闭源系统。
藏师傅 Kimi K2 Thinking 首测!教你用 Kimi 编程全家桶
本文首发测评藏师傅 Kimi K2 Thinking,介绍 Kimi 编程全家桶。K2 Thinking 有 Agent 化等多方面升级,还推出 Kimi CLI 工具与 KFC 套餐。作者展示全家桶使用方法并多维度测试,肯定其表现,赞 Kimi 战略清醒务实有远见。
阿里的未来,是通往超级人工智能
云栖大会上,阿里巴巴 CEO 吴泳铭演讲传达阿里对 AI 发展判断与战略规划。他认为 AGI 非终点,ASI 是目标,并提出实现三阶段。还指出阿里抓住大模型和 AI Cloud 支点,要把通义千问打造成 AI 时代 Android 系统。
Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!
8月17日,阿里发布的Qwen3.8 - 27B成Hugging Face热门第一。它以27B参数在部分测试中与前沿闭源模型比肩,可本地运行。不过推理慢、真实任务表现待提升,它让前沿Agent能力下放到个人电脑。
IEEE TAP|上海交通大学曹慧琳、南京大学任宇翔等:AI赋能电磁仿真:物理–数据混合驱动的PdEgatSCL模型实现高效建模
为实现电大尺寸目标快速精确建模,本文提出物理 - 数据混合驱动的PdEgatSCL方法,学习CFIE做端到端预测。用EGAT架构,编码格林函数等特征。测试显示它精度高、速度快、省内存,可加速电磁建模与逆向设计。
把20多种工具塞进一个搜索框!亲测「Agentic Search」后,我关掉了几十个浏览器标签页
秘塔AI推出Agentic Search,是“边想边搜,边搜边做”新搜索方式,能自主完成多步工具调用。作者测试其为AI笔记应用策划预热活动等场景,还测市场分析、编程学习、新媒体运营场景,虽有不足但未来可期。
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。
我的Codex是Claude Code 帮忙装好的……
OpenAI的Tibo称Codex CLI支持ChatGPT账号登录,Plus和Pro订阅用户可在命令行用GPT - 5。作者安装Codex遇问题,Claude Code帮忙解决。测试发现Codex有提升空间,作者认为Claude Code功能强大,建议人人开Claude Code Max。
字节押注AI Coding:百万月活的TRAE,如何改写开发者生态?|甲子光年
字节跳动在火山引擎Force 2025原动力大会主推自研AI编程产品TRAE,其月活超百万,内部80%工程师在用。AI Coding能提升大模型能力,助字节逼近AGI。TRAE更新功能,未来或成独立开发超级个体。
刚刚,Cursor被扒底裤!Claude Code套壳实锤,500亿估值全靠Ctrl+H?
知名开发者逆向分析发现,Cursor 3.0实锤套壳Claude Code,将其包装成「自主研发」。Cursor官方称是A/B测试,但证据显示更像正式集成。此事折射出AI应用层困境,应用层玩家只能在「外围战场」厮杀。