「测试时深思」共找到 2281 篇相关文章
Anthropic刚发布了一份「AI抢饭碗报告」:学历越高越「被抢」
Anthropic《经济指数报告》揭示,任务越复杂AI加速越猛,学历高的工作受影响大。还指出人机协作能大幅提升任务时长,不同国家AI应用有贫富和技术代差,也提到了‘去技能化’问题及对生产率的预测。
又是王冠:27M小模型超越o3-mini!拒绝马斯克的00后果然不同
27M小模型HRM由拒绝马斯克的00后王冠开发,超越o3 - mini - high和DeepSeek - R1,推理不靠思维链。它采用分层推理等五项核心技术,在多测试中表现出色,虽被指通用性不足,但有人看好其仿脑架构。
Sora 2 惊现 LLM 推理能力,视频生成模型也能搞推理?
Sora 2在科学推理基准测试中获55%成绩,虽不敌GPT - 5,但一个视频生成模型能做推理令人惊讶。Epoch AI实验发现其可能借LLM重写提示词答题,网友也证实背后或有GPT - 4o等处理。此外,Google研究显示视频模型经大量训练或有推理能力。
北航,清华,北大联合发布: 异构智能体协同强化学习!
北航、清华、北大联合发布异构智能体协同强化学习论文。提出 HACRL 新范式,实现异构智能体双向互学与独立部署统一;还有 HACPO 算法弥合智能体差异。实验显示性能提升且成本降低,为多智能体协同学习指明方向。
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。
Gemini 3来了,Software 3.0也快了
作者认为Gemini 3是目前最好的模型,编程时前端用Gemini 3,后端用Codex。无编程需求时,它也能助力信息处理。Google推出Generative UI,二者结合让我们接近Software 3.0。
担心被曝“于谦门”,57岁的于谦到底用龙虾做了什么?
于谦视频播客《多新鲜呐》最新一期,本质是“AI产品用户体验公开测试”。于谦作为测试员,关注点在结果、省事、风险等,节目把技术叙事换成生活叙事,帮AI面向大众转译。
刚刚,Grok 4发布,「人类最后的考试」中拿下50.7%,碾压所有对手,游戏结束?
Grok 4发布并对X Premium+订阅者开放。它是领先的AI模型,人工智能指数超对手,全方位性能爆表,还具备实用功能。在「人类最后的考试」拿下50.7%,显示AI智能增长无上限。
苹果憋一年终超同参数 Qwen 2.5?三行代码即可接入 Apple Intelligence,自曝如何做推理
今年 WWDC 大会上,苹果推出专为增强 Apple Intelligence 功能的语言基座模型,含约 3B 参数紧凑型与基于服务器的混合专家模型。经优化可在苹果芯片高效运行,改进工具使用与推理能力,评测显示设备端模型表现优。
给Claude Code加个音效提醒
文章指出Claude Code缺少提醒功能,作者用Claude Code自带的hooks功能和macOS系统的afplay工具,实现音效提醒。需要确认时播放塞尔达传说BGM,完成时播放超级马里奥BGM,还介绍配置方法。