「token定义权」共找到 1162 篇相关文章
真够卷的!DeepSeek更完智谱更:GLM-4.6,代码国内最强
前脚DeepSeek更新到V3.2,智谱又推出GLM-4.6,代码能力达国内最强。测试显示其在多方面表现出色,还降低平均token消耗。寒武纪、摩尔线程跟进适配,价格也降低。
AI越训练,越会「满嘴跑火车」!普林伯克利重磅揭秘,RLHF竟是罪魁祸首?
普林斯顿和伯克利研究《Machine Bullshit》,定义并量化LLM胡扯行为,总结四大套路,提出胡扯指数。实验发现强化学习人类反馈训练后,AI胡扯倾向加重,多思考也会让其更会忽悠。
Kimi K2发布两天即“封神”?80%成本优势追平Claude 4、打趴“全球最强AI”,架构与DeepSeek相似!
国内独角兽月之暗面发布开源模型 Kimi K2,推出两天就在 OpenRouter 超越 xAI 的 Grok 4。它成本优势大,能力泛化和实用性强,编码、Agent 工具调用等方面表现出色,架构与 DeepSeek 相似。
2025上半年大模型使用量观察:Gemini系列占一半市场份额,DeepSeek V3用户留存极高
推特博主「karminski - 牙医」基于OpenRouter数据,分析2025年上半年大模型API市场,涵盖总Token使用量、市场份额、细分领域用量、API接口使用趋势等,得出各模型表现及市场格局的观察结论。
“多模态方法无法实现AGI”
文章指出一些人认为多模态方法能实现AGI,但作者觉得此策略会失败。真正的AGI要理解物理世界,而LLMs只是记忆规则。此外,规模最大化方法用于AGI有数据稀缺问题,多模态建模也存在诸多问题。
Ilya Sutskever多伦多大学最新演讲:即将上大学或正在上大学的强烈建议围观
2025年6月6日,ChatGPT之父Ilya Sutskever重返多伦多大学获荣誉理学博士学位并演讲。他分享人生建议,指出AI定义了“最不寻常时代”,建议学生体验使用AI,称其是人类最大挑战与机遇。
姚顺雨提到的「AI下半场」,产品评估仍被误解
OpenAI研究员姚顺雨提出「AI下半场」重点转向定义问题,评估重要性超训练。亚马逊Eugene Yan发文补充,指出产品评估常被误解,应运用科学方法,践行评估驱动开发,自动化工具也需人工监督。
九成以上模型止步白银段位,只有3个铂金!通用AI下半场评测标准来了
OpenAI研究员姚顺雨提出AI发展步入新阶段,下半场关键在评估模型真实智能。新加坡国立大学等团队提出“通才智能”评测框架,剖析多模态大模型短板,推出五级评估体系和测试集,测试结果暴露模型弱点,引发社区积极反响。
突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力
多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。
Jeff Dean最新访谈:基础模型越来越强,小团队如何与谷歌等巨头竞争?
Jeff Dean 在 Y Combinator 活动中与 Diana Hu 对谈,探讨 AI 创业者面临的问题。他指出推理成新瓶颈,预计有更多推理硬件;Agent 执行复杂任务进步快;小团队可找 1%成功率问题;还提及稀缺能力及创业建议。