「小模型超越大模型」共找到 8442 篇相关文章
没绷住...美团竟然做了个这?
美团推出产品 xia345,它聚合主流 AI Agent 客户端、技能市场和 LLM 模型等信息,功能不复杂但信息密度高。其有清晰新手路径,还能成 Agent 技能。产品经理规划了新功能,目标成 Agent 时代迪士尼乐园。
刚刚,美国AI霸主换了!Anthropic年收300亿,碾压OpenAI
外媒披露Anthropic年化营收达300亿美元,超越OpenAI的240亿。Anthropic由OpenAI前员工创立,15个月营收翻30倍,训练成本仅为对手四分之一。其80%收入来自企业端,而OpenAI陷入‘增收不增利’怪圈,内部也矛盾重重。
全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来
这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。
罗振宇、张鹏、王立行等齐聚一堂,AIFUT大会Day1上午场的全面总结来了。
AIFUT大会首日上午,多位嘉宾分享观点。王磊谈亦庄如何拥抱AI;卡兹克称身份被重新定义,好奇心不可被定义;罗振宇认为人最后价值是告诉AI要什么;还有Tim、张鹏、谷大白话、王力行等分享见解。
不拼GPU!中兴扔出AI超节点,把token价格打下来
在万亿级大模型时代,传统‘芯片堆砌’方式面临通信开销剧增等痛点。中兴通讯推出超节点技术,从系统级协同架构出发,通过六大维度创新,绕开单GPU芯片瓶颈,重构AI算力基础设施,推动行业向开放、融合发展。
求码10天,我终于过上了在微信上使唤🦞的日子
腾讯鹅虾产品QClaw升级,将微信入口变为小程序,支持传文件,上线灵感广场。作者求码10天体验它,测试其在微信和电脑端操作能力,肯定便捷性,也指出执行流程不透明等问题。
ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字与图像在统一架构中共同演化
NUS、ZJU 等联合提出「ThinkMorph」,主张文字与图像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。
智能体时代的强化学习:AReaL 框架与 Agent 最佳实践
本文整理自吴翼博士在 2025 年 QCon 全球软件开发大会的分享。他介绍 AReaL 框架及 Agent 最佳实践,阐述强化学习与大模型联系,指出 Agent 是 AGI 未来 5 年关键,强化学习是 Agent 技术核心,还分享团队成果与经验。
为什么BF16的FlashAttention会把训练「炸掉」?清华首次给出机制解释,用极简改动稳住训练
社区里长期存在的FlashAttention+BF16训练GPT - 2时loss突然爆炸的问题,清华团队论文给出机制解释。指出是特定条件下数值偏置被放大所致,还给出极小修改稳定训练,且在多模型和硬件上验证有效。
Greg Brockman(OpenAI 联合创始人)把“那场宫斗”讲完整了:董事会、请愿书、马斯克与控制权
OpenAI联合创始人Greg Brockman做客播客,讲述公司“宫斗”内幕、与马斯克谈判细节等。还谈及模型能力、算力瓶颈、AI应用等,如GPT 5.1到5.2有质的飞跃,算力将成基本人权,AI推翻物理假设。