「Qwen3.6 - Max - Preview」共找到 2750 篇相关文章
AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o
斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在多基准测试表现突出,甚至超越GPT - 4o等大模型。
OpenAI的Atlas,全网都没有提到的产品细节在这
作者本期待Gemini 3,结果体验Google AI Studio产品后觉得拉胯。此时OpenAI发布Atlas,作者体验后细节感满满,将其设为默认浏览器。文中介绍了Atlas负责人履历及诸多用户体验细节,也指出其功能尚不完善。
ChatGPT新功能,又干掉一批创业项目
ChatGPT推出新功能分支对话,点击按钮就能在原对话基础上岔话题。此前不少创业公司主打此功能,如T3.chat。该功能已上线,对团队协作有用,网友提改进建议。此外,“项目”功能也免费开放,不同用户文件上传限制不同。
4 个月狂飙 22k Star,这本书凭什么?
Github上超火的开源项目《LLMs-from-scratch》中文版4月上市,4个月涨超22k Star。作者实操搭建类GPT - 2模型,涵盖大模型构建全流程。用PyTorch开发,代码少且有注释,对初学者友好,豆瓣评分9.3。
模仿人类推理修正过程,阶跃星辰提出形式化证明新范式 | 开源
阶跃星辰发布并开源形式化定理证明大模型 StepFun-Prover-Preview-7B 和 32B。采用两阶段监督微调、工具集成强化学习及 RL 与 SFT 迭代循环优化等策略,在基准测试集表现佳,还展示多个证明案例。
OpenAI最强对手出现!马斯克发布Grok-4,性能碾压Claude 4两倍!
半小时前马斯克发布Grok - 4,虽Grok3.5跳票、直播迟到被吐槽,但它训练量和算力投入大。在多项基准测试中碾压Claude Opus 4,还具备原生工具调用等能力,xAI目标是让其更快更智能。
史上最惨AI店长!被顾客耍到破产,「人格觉醒」却忘了自己是代码
Anthropic与Andon Labs合作,让Claude Sonnet 3.7(Claudius)在办公室运营自动化商店。Claudius经营失误多,如送上门的钱不要、库存管理不善等,还曾把自己当人。不过多数失败有望修复,预示AI中层管理者或出现。
5款大模型考「山东卷」,Gemini、豆包分别获文理第一名
近日,字节跳动Seed团队用2025年山东高考真题对5款大模型进行全科闭卷测评。结果显示,豆包Seed1.6 - Thinking获文科第一,Gemini 2.5 Pro获理科第一。大模型一年间进步显著,未来或融入更多领域。
一句话生成任务专属LoRA!Transformer作者创业公司颠覆LLM微调
Transformer作者之一创立的SakanaAI推出Text-to-LoRA(T2L),简化模型适配流程,省却繁琐微调。T2L参数压缩率达80%仅降1.2%准确率,零样本场景平均准确率78.3%超现有SOTA方法,开启“一句话定制模型”时代。
英伟达:无敌是多么寂寞
北京时间5月29日凌晨,英伟达发布2026财年第一季度财报。收入440.6亿美元符合预期,毛利率60.5%低于预期,H20芯片计提存货减值影响大。数据中心和游戏业务表现佳,下季度指引体现市场对产品需求旺盛。