「大模型推荐」共找到 9363 篇相关文章
大模型"温故而知新"实现了!无需历史数据,Octopus 效果超越全数据训练|CVPR‘26 Octopus
上海交通大学与vivo团队提出全新持续学习框架Octopus,首创无需历史数据的梯度正交化技术。实验显示,它在UCIT基准上表现超SOTA方法,还实现正向后向迁移,适合端侧部署。
京东广告大模型实战:GRAM 架构如何在 50ms 内完成生成式推荐?
流量红利见顶,广告营销转型遇挑战。京东张泽华在大会公开应对方案,介绍 GRAM 架构,实现意图与商品语义对齐,控制推理时延,解决冷启动等问题,还分享算法与知识工程实践。
一句话,性能暴涨49%!马里兰MIT等力作:Prompt才是大模型终极武器
马里兰大学、MIT、斯坦福等机构研究发现,AI性能提升一半靠模型,一半靠提示词。他们让DALL - E 2和DALL - E 3 PK,发现DALL - E 3性能提升中,模型升级贡献51%,提示词优化贡献49%。
Qwen紧追OpenAI开源4B端侧大模型,AIME25得分超越Claude 4 Opus
Qwen团队深夜开源两个端侧模型Qwen3 - 4B - Instruct - 2507和Qwen3 - 4B - Thinking - 2507,尺寸对端侧友好,支持256k上下文。后者在AIME25测评得分超Claude 4 Opus,两模型能力较前作均有提升。
都在卷「让大模型多循环几遍」,这个7B模型LoopCoder v2说:多循环 1 次就够了
一项新研究表明,7B小模型LoopCoder v2在正常计算外多循环一次,就能在SWE - bench Verified基准上大幅提分。继续增加循环次数,性能反而下降。研究还算了‘收益 - 成本’账,给出选择循环次数的诊断方法。
陈天桥旗下AI公司MiroMind打造全球顶尖预测型大模型,性能登顶行业基准
全球首个动态实时LLM智能体未来预测基准FutureX推出,陈天桥旗下MiroMind团队连续两周蝉联冠军。其模型采用记忆驱动机制,为预测与决策设计,还展现了在多领域的预测能力,且将开放相关框架和模型。
YOLOv8 模型训练入门指南:手把手搞定目标检测AI
本文是从零训练 YOLOv8 模型的完整实录,介绍了 YOLOv8 特点,以“识别猫”为例,详述训练步骤,指出训练难点,还推荐学习资源与工具,鼓励前端程序员尝试做 AI 模型训练。
Transformer | 一文带你了解Embedding(从传统嵌入方法到大模型Embedding)
文章介绍Embedding基础知识,从传统统计方法到如今大模型用例演变过程。涵盖传统、静态、上下文及大模型Embedding技术,如TF - IDF、word2vec、BERT等,还剖析DS - Qwen1.5B的Embedding并以图展示。
模型越聪明越“不听话”?MathIF基准揭示AI服从性漏洞
上海人工智能实验室与香港中文大学研究团队发布论文,用MathIF基准揭示大模型“聪明”和“听话”有矛盾,越擅长推理越易忽略指令,还分析了原因并给出让模型更“听话”的方法。
谷歌技术报告披露大模型能耗:响应一次相当于微波炉叮一秒
大模型耗电舆论高,谷歌用数据还击。谷歌首席科学家称Gemini能耗低于预期,一年间能耗降至1/33,碳排放降至1/44。谷歌用更全面指标计算能耗,还从多方面优化使Gemini能耗降低。