「GPT - 5.1 Codex Max」共找到 3786 篇相关文章
谷歌靠Nano Banana超越ChatGPT!登顶苹果App Store第一,玩疯了玩疯了
谷歌Gemini凭借Nano Banana超越ChatGPT,在多地苹果App Store登顶。Nano Banana好用且免费,驱动Gemini新增2300万用户,还用于编辑超5亿张图片。文章盘点了Nano Banana多种玩法及提示词,谷歌也借此逆袭。
ClockBench:一个简单的钟表测试让AI全线溃败
ClockBench测试让11个多模态大模型与5个普通人认钟表时间,人类平均准确率89.1%,最好的AI仅13.3%。AI在复杂钟面表现差,却能处理抽象指令。该测试暴露视觉AI空间推理缺陷,对评估有启发。
本周推荐的5个超级6的Github开源项目!
文章推荐了5个Github开源项目。如htmx,能在纯HTML搞定多种交互,无需JS;Flow.Launcher可快速搜索文件、启动应用;Maple Mono是编程字体,中英2:1对齐;Trilium Notes是分层笔记神器;Hyprnote可实时转录会议内容。
Temporal:Nvidia、OpenAI 都在用,为什么 Agent 还需要专门的长程任务工具?
本文编译了 Temporal CTO Maxim Fateev 的访谈。Temporal 提出 durable execution,确保工作流可靠执行,即使出错也能继续。它获 1.46 亿美元 C 轮融资,Nvidia、OpenAI 是客户。不过,它也面临 AI 发展和云厂商竞争等挑战。
首创Mid-training范式破解RL奥秘,Llama终于追平Qwen!
上海创智学院和上海交通大学研究团队深入探讨不同基础语言模型在强化学习训练中的差异,提出中期训练策略,将 Llama 改造成适配 RL 的推理基础模型,缩小与 Qwen 性能差距,还发布了 MegaMath-Web-Pro-Max 数据集。
Granola:ChatGPT、Notion 都入场的 AI 纪要,能真正沉淀工作流吗?
AI 发展带动大量 AI 纪要工具兴起,Granola 凭借新颖 AI 交互方式和对 AI 产品的深入思考,成为领域后起之秀。它提供 AI 补充人工笔记功能,改变了很多知识工作者工作流,但也面临用户习惯和大模型公司切入等挑战。
多模态大模型不会画辅助线?最新评估得分:o3仅25.8%,远低于人类82.3% | 清华腾讯斯坦福联合
清华、腾讯、斯坦福等团队发布RBench - V基准测试,评估大模型视觉推理能力。结果显示,主流大模型如o3、Gemini2.5等准确率远低于人类,开源模型表现更差,暴露出大模型在复杂多模态推理任务中能力不足。
建模世界偏好:偏好建模中的Scaling Laws
研究首次揭示人类偏好建模遵循Scaling Law,从论坛收集数据在Qwen 2.5模型训练,发现测试损失随训练规模指数增长线性下降。提出建模世界偏好,论文和模型已开源,还探讨了偏好建模可扩展性等问题。
时隔两月,Mistral AI终于上新Medium 3,近期还有「One more thing」
时隔两月,Mistral AI 推出 Mistral Medium 3,性能介于轻量级和大规模模型间,优于 GPT - 4o 等。未开源,可通过官网等使用,专为企业设计,成本低。还预告将推「大型」产品,同时推出企业聊天机器人 Le Chat Enterprise。
每周2亿年轻人用ChatGPT,却连高手的零头都没用出来
全球超2亿18 - 24岁年轻人用ChatGPT,高阶用户调用能力仅为超级用户1% - 10%。OpenAI推出三款教育插件,分别针对K - 12老师、大学老师和大学生,还搭建教育闭环,不过教学权仍在教师、学校和政府手中。