「自奖励训练」共找到 3130 篇相关文章
年轻人的第一个爱马仕
AI圈的Hermes是Nous Research开发的开源Agent框架,GitHub星数超35000。作者写76页《Hermes Agent从入门到精通》,介绍其设计思路、使用方法等,中英文版可在GitHub免费下载。
打破视觉Token的算力诅咒,RedundancyLens如何为多模态大模型推理减负
多模态大模型的 Decoder - only 架构处理视觉 Token 有计算冗余。合合信息团队提出无需额外训练的动态计算削减方法,在不影响性能前提下降低推理成本,适用于多场景。
从它石智航的世界纪录里,我看到了具身大模型落地干活的希望
在上海AWE展会,它石智航的A1机器人获“机器人在一小时内装配亚毫米级线束最多次数”吉尼斯世界纪录。这得益于它石自研通用具身大模型「AWE3.0」,该模型实现多项突破,推动具身智能落地。
执行力通货膨胀的AI时代,什么才是你真正的资产?
在AI时代,执行力正在通货膨胀,劳动市场估值逻辑改变。文章指出判断力、品味、信任资本、意义感将成为稀缺资产,因AI在这些方面有局限。还给出提升这些能力的行动建议。
不止修bug:Agentic Coding评测走向复杂feature交付新阶段
中国科学院自动化研究所联合华为提出 FeatureBench,构建端到端基础设施并开源。它从单元测试出发构造评测任务,引入多种机制保障任务可执行、可验证,能有效区分模型能力,还提供易用的评测流程。
ICLR 2026 | 7B小模型干翻GPT-5?AdaResoner实现Agentic Vision的主动「视觉工具思考」
文章介绍了AdaResoner模型,它学会‘何时用工具’,在拼图推理上击败GPT - 5。Google为Gemini 3 Flash引入‘Agentic Vision’,与AdaResoner殊途同归。AdaResoner有独特训练方法,提升小模型性能。
辟谣丨谷爱凌并未加入风投机构 Benchmark,原图为 AI 捏造
2月13日,自媒体传播“谷爱凌加入风投机构Benchmark”,实则是假新闻,配图为AI捏造。背后是地缘政治黑色幽默,谷爱凌和Benchmark合伙人因“中国元素”遭美国强硬派舆论围攻。
别再让语音机器人“答非所问”:AI Force任务型语音对话技术总结
本文围绕企业级任务型语音Agent核心挑战,提出解决“拟人化”与“专业化”问题。介绍三段式语音对话解法、架构演进,还提及‘衍算’推理框架等技术及未来方向,团队来自蚂蚁集团AI force。
清华刘知远团队论文:最小化结构改动,短文本到长文本丝滑升级 | ICLR 2026
大语言模型发展中,上下文长度成关键瓶颈,主流架构计算开销大。清华刘知远团队提出《InfLLM-V2: Dense-Sparse Switchable Attention for Seamless Short-to-Long Adaptation》,提出可切换注意力框架,为长上下文研究提供新思路。
美团智能体SOTA模型LongCat-Flash-Thinking-2601开源
美团龙猫团队开源智能体推理模型LongCat - Flash - Thinking - 2601,总参数5600亿。该模型在多方面有卓越表现,团队通过构建数据、模拟环境、采用强化学习策略及设计高效架构等,使其比肩闭源模型。