「高级推理测试」共找到 3458 篇相关文章
对标GPT-4o和香蕉!浙大开源ContextGen:布局身份协同新SOTA
浙江大学ReLER团队开源ContextGen框架,攻克多实例图像生成中布局与身份协同控制难题。基于Diffusion Transformer架构,用双重注意力机制实现布局精准锚定与身份高保真隔离,在基准测试中超越开源SOTA模型,对标GPT - 4o等闭源系统。
吴恩达年终总结:2025是AI工业时代的黎明
吴恩达发表2025人工智能年度总结与公开信。总结指出,今年推理模型性能提升但有成本,AI人才争夺激烈、薪酬高,数据中心建设投入大,智能体让编程更高效。信中建议通过学课程、动手实践和读论文构建AI系统。
IEEE TAP|上海交通大学曹慧琳、南京大学任宇翔等:AI赋能电磁仿真:物理–数据混合驱动的PdEgatSCL模型实现高效建模
为实现电大尺寸目标快速精确建模,本文提出物理 - 数据混合驱动的PdEgatSCL方法,学习CFIE做端到端预测。用EGAT架构,编码格林函数等特征。测试显示它精度高、速度快、省内存,可加速电磁建模与逆向设计。
把20多种工具塞进一个搜索框!亲测「Agentic Search」后,我关掉了几十个浏览器标签页
秘塔AI推出Agentic Search,是“边想边搜,边搜边做”新搜索方式,能自主完成多步工具调用。作者测试其为AI笔记应用策划预热活动等场景,还测市场分析、编程学习、新媒体运营场景,虽有不足但未来可期。
GPT-5编程测评大反转!表面不及格,实际63.1%的任务没交卷,全算上成绩比Claude高一倍
Scale AI的新软件工程基准SWE - BENCH PRO测试中,‘御三家’表面解决率低。深入看,GPT - 5已提交任务准确率比Claude高一倍。该基准新题多、更复杂,能真实考验模型能力,当前模型解决商业问题能力有限。
我的Codex是Claude Code 帮忙装好的……
OpenAI的Tibo称Codex CLI支持ChatGPT账号登录,Plus和Pro订阅用户可在命令行用GPT - 5。作者安装Codex遇问题,Claude Code帮忙解决。测试发现Codex有提升空间,作者认为Claude Code功能强大,建议人人开Claude Code Max。
「Next-Token」范式改变!刚刚,强化学习预训练来了
微软新研究提出「强化预训练(RPT)」新范式,将下一个 token 预测任务重新定义为推理任务,可利用海量文本数据进行通用强化学习。该方法有可扩展性、低风险等优点,实验显示其提升了语言建模能力。
刚刚,Cursor被扒底裤!Claude Code套壳实锤,500亿估值全靠Ctrl+H?
知名开发者逆向分析发现,Cursor 3.0实锤套壳Claude Code,将其包装成「自主研发」。Cursor官方称是A/B测试,但证据显示更像正式集成。此事折射出AI应用层困境,应用层玩家只能在「外围战场」厮杀。
马斯克的底裤要被扒光了!超级爆料一个多小时, xAI 工程师被火速解雇
xAI工程师Sulaiman Ghori在播客大赞公司与马斯克,3天后却被解雇,或因曝光诸多敏感信息。他讲述公司无官僚流程、多线并行高效,马斯克决策快且能快速解决问题,公司还测试虚拟员工等。
OpenAI深夜祭出GPT-5,所有人能免费用!Altman:像和博士级专家对话
北京时间8月8日凌晨,OpenAI推出GPT - 5,宣称其更智能、准确,幻觉率低。还推GPT - 5 - mini和GPT - 5 - nano两款新模型,免费用户可使用部分版本。它在编程和健康领域测试表现出色,引发各界热议。