「新推理模型」共找到 9685 篇相关文章
前Meta大神创业,用强化学习打造PokeeResearch-7B模型,刷新AI深度研究SOTA
Pokee AI发论文介绍70亿参数的PokeeResearch - 7B模型,用基于AI反馈的强化学习和推理框架,在深度研究基准测试中成绩领先。该公司由前Meta大神创立,产品可打通多应用,已获融资并公开测试。
OpenAI夺金IOI,但输给3位中国高中生
OpenAI官宣其推理模型在今年IOI线上竞赛中成绩刷新纪录,总分533.29,全球330名人类选手中排第六,AI参赛者中居首。不过其没比过三位中国高中生。此前OpenAI称模型获IMO金牌引争议,此次网友更谨慎。
图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成
Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。
OpenAI和Anthropic费尽心机加密的思维链,竟然能被轻松提取?
围绕大模型蒸馏争议已久,此前外部团队难获闭源模型完整推理。8 月 10 日研究者公开方法,可让弱模型读取旗舰模型密文并输出推理,还发现公开智能体轨迹存在隐私泄露问题,不过未为蒸馏指控提供决定性证据。
刚刚!Sam Altman官宣:Plus用户GPT-5推理提至每周3000次,AI版电车难题已来
Sam Altman官宣ChatGPT Plus用户GPT - 5级推理额度提至每周3000次,还将更新UI、公布算力权衡策略。同时指出GPT - 5推出带来AI情感依恋及伦理困境,如AI成情感寄托时公司如何应对等问题。
深夜突袭!谷歌Gemini 2.5 Pro更新蝉联榜一:推理超越o3,编程超越opus4
深夜谷歌对Gemini 2.5 Pro模型重大更新,在编码、推理等测试中超越o3,几周内成稳定版。其价格优势大,还增加思考预算,输出风格和结构改进,用户实测反馈佳,但发布不久被越狱攻击。
用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?
北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。
医疗幻觉率比DeepSeek低3倍,百川循证增强大模型横扫全球医学考试!
百川智能发布首个循证增强医疗大模型Baichuan - M2 Plus,将循证医学理念融入训练和推理,首创六源循证范式。其在多场景评测中幻觉率低,多国医考成绩优异,已上线百小应APP并开放API。
从数据分布视角,重新认识下CoT
本文从数据分布视角重新审视大语言模型的思维链(CoT)推理。指出CoT并非真正推理,而是模仿,其效果受训练与测试分布差异影响。通过实验揭示CoT在分布偏移时性能退化,提醒勿过度依赖。
Docker Desktop 4.42 发布,带来原生 IPv6、集成的 MCP 工具包以及 AI 模型打包功能
Docker 公司发布 Docker Desktop 4.42 版本,增强网络灵活性、AI 工作流集成和模型分发功能,如新支持原生 IPv6、集成 MCP 工具包等。但 macOS 用户反馈稳定性下降,有启动、网络等问题。