「数学推理测试」共找到 3516 篇相关文章
故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究
OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。
刷屏的SBTI,底层算法有点东西…
近期SBTI人格测试爆火,它出自B站UP主Q肉儿串儿,初衷是劝朋友戒酒。经分析,它大概率是“人工主导+AI辅助”的产物,技术架构简单,算法逻辑是答题拆维度、分数归档、模板匹配。此外,还有大神网友推出MBAI版测试题。
7个AI玩狼人杀,GPT-5获断崖式MVP,Kimi手段激进
OpenAI总裁转发基准测试,让7个LLMs玩210场狼人杀。GPT - 5胜率96.7%断崖式领先,国产Qwen3和Kimi - K2分列第4、6。测试方分析模型性格,还借此研究LLMs社会行为,长远目标是实现AI驱动的市场研究。
打脸OpenAI!谷歌Gemini高级版获IMO 2025官方认证金牌:纯自然语言端到端推理
谷歌DeepMind宣布高级版Gemini在2025年IMO中6题解5题获金牌,经官方认证,全程用自然语言推理。对比OpenAI自我宣称拿金牌,谷歌成绩更有说服力,还介绍了Gemini进步及实现方法。
CVPR 2026 | 20步也能稳住画质,这个扩散加速方法不一样
扩散模型推理效率是落地应用的核心制约因素,阿里安全 AGI 实验室 - 御风大模型团队联合浙江大学提出全新扩散加速方法 TC - Padé,在低步数设置下能兼顾生成质量与推理效率,已被 CVPR 2026 录用。
奥特曼点评中美AI牌桌:美国猛攻前沿,中国凭“两张王牌”错位竞争
OpenAI CEO 萨姆·奥特曼在贝莱德峰会上指出,从 o1 到 o3 模型,复杂推理成本降 1000 倍,2028 年末数据中心 AI 认知能力或超人类。他还拆解中美 AI 竞争,美国前沿领先,中国旧模型推理成本控制和基建推进有优势。
重磅!OpenAI时隔五年再发布开源模型gpt-oss:开源SOTA,可在16g笔记本运行
谷歌推出Genie 3后,OpenAI宣布发布开源推理模型gpt-oss,有gpt-oss-120b和gpt-oss-20b两个型号,采用混合专家架构和4位量化方案,能快速推理,原生支持128k上下文长度。文章还介绍了模型表现、训练等情况。
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
随着模型规模增长、新应用兴起,大模型基础设施面临管理「张量状态」挑战。北大、阶跃星辰与北邮联合提出 TensorCast,解耦张量状态,复用管理能力,在多场景测试中表现出色,为大模型基建提供新范式。
亿级日活App的“算力生死劫”:推理成本倒挂,他们靠跨云架构砍掉75% GPU集群
一家AI穿搭+购物推荐的出海应用DAU破亿,但算力和传输成本高,ARPU远低于成本。该企业转向Akamai推理云,换用RTX PRO 6000,缩减服务器集群,降低成本,采用跨云架构过渡,实现零阵痛平替。
奥特曼深夜官宣:OpenAI重回开源!两大推理模型追平o4-mini,号称世界最强
OpenAI深夜推出gpt-oss 20B和120B两款开源模型,性能比肩o3-mini和o4-mini,能在消费级显卡甚至手机运行。有宽松许可证等亮点,还准备了体验网站。这是自GPT - 2后首次开源,降低了部分群体准入门槛。