「人类推理」共找到 3125 篇相关文章
谷歌发布 Gemma Scope 2,深化对 LLM 行为的理解
Gemma Scope 2 是谷歌推出的解释 Gemini 3 模型行为的工具,结合稀疏自编码器和转码器,能让研究人员检查模型内部表示。它从多方面扩展了原先的 Gemma Scope,还引入针对聊天机器人的分析工具,已发布权重。
告别“一眼定生死”:Agent-as-a-Judge 开启 AI 评估的下半场
过去两年,LLM-as-a-Judge成评估界“黄金标准”,但面对复杂任务力不从心。论文《A Survey on Agent-as-a-Judge》指出,应从单一的大模型裁判进化为具备行动能力的智能体裁判,还阐述了其优势、发展阶段等。
一年后,DeepSeek-R1的每token成本降到了原来的1/32
几天前,DeepSeek更新R1论文至86页,公开训练全路径等细节。英伟达发表博客展示在Blackwell GPU上对其降本增效,通过软硬协同提升每瓦特Token吞吐量,还介绍了TensorRT - LLM软件及相关技术提升性能的情况。
曾对AI嗤之以鼻,如今2周生成7万行代码:Rust大佬与Claude联手打造新语言Rue
2025年,Rust社区早期核心人物Steve Klabnik心态转变,开始借助Claude编写代码。他重启念头设计新语言Rue,探索编程语言‘中间地带’,两周生成约7万行代码,开发中人与AI分工明确。
OpenAI内部代码泄露!最强模型「皇帝」登基,0思考延时吓人
OpenAI代码泄露,神秘的「企鹅家族」模型在测试,代号Emperor的推理预算最高。同时,ChatGPT将推「记忆搜索」功能。此前谷歌Gemini 3抢份额,OpenAI或提速发布GPT - 5.2抗压。
奥特曼怕了!GPT-5.5「大蒜」决战谷歌,红色警报紧急拉响
三年前ChatGPT让谷歌恐惧,如今OpenAI被谷歌逼得拉响‘红色警报’。OpenAI计划发布新推理模型,‘Garlic’预训练有突破,还启动下一代模型。OpenAI调整策略,聚焦提升ChatGPT体验。
300只狗试用延寿药,「寿命曼哈顿计划」启动!
1300只狗参与「延长寿命」实验,被注射由AI计算剂量的「延寿药」。AI在医疗领域作用凸显,制药、临床研究等多方面有进展。Altman等名人押注「永生」,但长寿也带来伦理等诸多问题。
LLM 没意思,小扎决策太拉垮,图灵奖大佬 LeCun 离职做 AMI
图灵奖得主 Yann LeCun 宣布年底从 Meta 离职创业,聚焦高级机器智能研究项目 AMI。他离职是因与 Meta 在 AI 发展路线上冲突,且不满 LLM,坚持基于“世界模型”的下一代 AI 技术。
超实用提示词模板!AI科学家教你用协作提示词激发大模型潜力
文章由知名AI科学家Lance Eliot所写,指出主流大语言模型因训练机制变得‘短视’,缺乏深度协作能力。介绍协作提示词技术,能让AI成为主动引导者,并以测试展示效果,还说明了适用场景。
美团LongCat扎扎实实做了件难事:LLM数学新天花板AMO-Bench
美团LongCat团队联合高校推出AMO - Bench,用50道原创奥赛级难题评估LLM数学能力。它解决现有基准测试痛点,经四重把关构建,测试显示顶级模型表现不佳,也揭示模型提升空间大。