「系统2慢思考」共找到 3964 篇相关文章
一键式训练端到端Agent,Qwen3+MCP工具集高效集成!
RLFactory是开源的端到端RL后训练框架,将环境与训练解耦,用Qwen3基座调用MCP工具集,可低代码训练端到端Agent模型。它极致易用、训练高效,还支持一键式训练,未来会更易用高效。
ParScale:一种全新的大模型Scaling Law
文章提出并行扩展(ParScale)路线,在不增模型参数下,通过引入并行流提升性能。新扩展定律打破传统范式,两阶段后训练策略降成本,还适用于边缘设备,研究仍在进行。
LLM又曝致命缺陷:根本不会看时钟!博士惊呆,准确率不及50%
最新研究揭示AI存在认知缺陷,读取时钟准确率仅38.7%,判断日历日期准确率26.3%。研究者构建测试集考察MLLM能力,虽部分模型有亮点,但整体表现不佳,凸显训练数据和推理方式改进需求。
ICML25 | 让耳朵「看见」方向!仅依靠360°全景视频,就能生成3D空间音频
空间音频技术成提升沉浸式体验关键,但现有技术未充分利用360°全景视频空间信息。OmniAudio研究可直接从360°视频生成空间音频,相关代码和数据集已开源,虽有局限但前景好。
以星为舵:LLM的Post-Train与Rest-Time奖励学习综述
这篇论文提出奖励信号像AI的“导航星”,引导模型优化行为。介绍奖励学习概念、来源、形式和策略,阐述其贯穿LLM生命周期的三个阶段,探讨奖励模型设计选择,还提及实际应用、挑战与未来方向。
睡觉也在卷!伯克利Letta新作「睡眠时计算」让推理效率飙升
Letta和UC伯克利研究者提出「睡眠时计算」技术,能让LLM在空闲时间提前思考以提升推理效率,降低推理成本,在多数据集实验中展现优势,在软件工程任务中也有应用。
Claude 5.1双旗舰突然发布:跑分屠榜,反蒸馏,科研能力大幅跃升,缓存费用暴降75%
Anthropic发布Claude Fable 5.1和Claude Mythos 5.1两款大模型,性能登顶且解决开发者关注问题。缓存读取费用降75%,跑分屠榜,科研能力强,安全系统重构,合作实测效果好,盲测风格与GPT - 5.6 Sol不同。
评论送书 | 奇点何时到来?AI会成为人类的威胁吗 ?
文章从非线性非平衡多自由度系统的视角,探讨生成式AI未来发展态势,对‘规模扩大至临界点会实现奇点’及‘AI成人类威胁’的观点存疑,指出人类滥用AI才是现实威胁。
Claude Opus 5 发布,比 Fable 5 强,仅一半价格
Claude Opus 5发布,官方称其以一半价格提供接近Fable 5的智能。跑分显示它多数项目超Fable 5,ARC - AGI - 3成绩突出,还更省token,是Anthropic迄今对齐度最高的模型。
别再被昂贵 SEO 订阅费拿捏了:3.5k Star OpenSEO,直接做 Semrush/Ahrefs 开源替代
OpenSEO在GitHub约3.2k Star,想做开源版SEO工具箱,替代Semrush和Ahrefs。它把多项SEO工作流收进工具,通过MCP暴露给Agent,适合三类人,并非万能,是更开放的工具底座。