「端到端模型」共找到 9044 篇相关文章
The Batch:836 | 基准测试成本攀升
独立AI测试实验室披露评估推理模型成本上升。这些模型生成“思维链”提升输出质量,但计算需求增加,成本上升使资源有限组织难复现结果,且新模型定价、按需分配推理token也让成本更复杂。
新SoTA方法RM-R1:让reward model对评分说出原因!超越GPT4o
过去模型‘黑箱打分’不透明、不灵活。论文提出ReasRM,经两阶段训练,让奖励模型像人类先思考再打分。它能分任务类型、动态奖励,实验中碾压GPT - 4,小模型逆袭,团队已开源6个模型。
100万亿Token揭示今年AI趋势!硅谷的这份报告火了
OpenRouter和a16z联合发布《State of AI:An Empirical 100 Trillion Token Study with OpenRouter》,基于100万亿Token分析模型真实使用情况,揭示2025年AI发展趋势,如开源模型崛起、推理模型成新范式等。
codex负责人:codex就要过时了
Codex负责人称两三个月后Codex将过时,因下一代模型要处理大规模并发Agent,非其能应对。Huggingface实验显示大小模型在不同harness下排名差异大,脱离模型谈harness过时或不适配说模型Agent能力都不妥。
国产LLM又迎来一波开源潮:Qwen、华为盘古、腾讯混元、小米~
本周国产开源LLM集中爆发,Qwen、华为盘古、腾讯混元、小米等接连发布模型。如Qwen3 - 4B性能提升,Qwen - Image文生图能力强;华为开源盘古模型并宣布CANN开源;腾讯混元小尺寸模型特点多且已落地业务。
AI进化时间表已现!LLM每7个月能力翻倍,2030年职场不复存在?
LLM正飞速进化,METR研究发现其智能每7个月翻番。到2030年,一个模型几小时就能完成人类工程师数月的工作。该研究提出“任务完成时间视野”指标衡量模型能力,不同模型表现差异大。
GLM-4.5 验证:智谱已完成一轮“洗牌”
2025年大模型热度下降,智谱AI关注度降低。7月28日晚其发布新一代基础模型GLM - 4.5,体现战略调整成效。该模型专为AI Agent打造,性能出色,同时智谱人事、业务、收入等方面也有“洗牌”。
腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了
今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与长提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型。
震撼实锤!清华姚班校友揭「1.4×加速」陷阱:AI优化器为何名不符实?
为降低大模型预训练成本,近年新优化器频出,宣称加速1.4×到2×却难落地。斯坦福研究指出方法学缺陷,对比不同缩放范式加速差异,给出优化器设计见解,证实严格基准评测必要。
720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招
研究人员发现,将大模型返回的加密推理块扔给同厂小模型让其复述,就能破解大模型隐藏的思维链。如Anthropic、OpenAI、Google的模型均中招,还会带来隐私、安全等风险,虽已打补丁,但仍有难题。