「猜数偏好」共找到 463 篇相关文章
LLM也会emo,Claude玻璃心、Gemini社恐,Kimi/GLM/ DeepSeek如何?
华东师大和复旦大学研究8大模型家族是否有“情感链”。实验覆盖8大家族20+模型,发现各家族有独特“人设”,如Claude像“文艺青年”。还揭示模型在不同情境下的情绪变化及影响,给出实用建议。
1100多个模型殊途同归,指向一个「通用子空间」,柏拉图又赢一回?
约翰斯・霍普金斯大学研究发现,1100多个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间,表明架构比数据影响大。此发现能解释诸多现象,还有多种应用可能,但也有局限性。
稚晖君5000台机器人量产下线!创业仅3年,订单数亿元
33岁的“稚晖君”彭志辉创业仅三年,智元第5000台通用具身机器人量产下线,订单达数亿元。其三大产线机器人各有特点,应用于工业制造、讲解接待、文娱商演等场景。
推理效率狂飙60倍:DiDi-Instruct让扩散大模型16步超越千步GPT
普渡大学等研究者提出 DiDi-Instruct 后训练方法,可将扩散大语言模型推理加速 60 倍,超越传统 GPT 模型。该方法实现推理效率与效果双提升,为大语言模型落地提供新方案。
OpenAI以为GPT-5搞出了数学大新闻,结果…哈萨比斯都觉得尴尬
OpenAI研究员宣称GPT - 5找到10个厄尔多斯数学难题解法,引发全网震动。但DeepMind CEO哈萨比斯指出是营销过度,GPT - 5只是搜到已有答案。OpenAI已删稿,此前GPT - 5有一定数学解题能力。
没想到,32B清华DeepDive掀翻深度搜索全场的!
文章指出大模型在真实深网搜索场景表现不佳,核心矛盾是缺‘难搜’数据和多轮工具调用 RL。清华 DeepDive 用数据合成造‘难搜’题,端到端多轮 RL 训练,在 BrowseComp 刷新开源记录,迁移能力也强。
119 页硬核报告丨AI 2030:算力、能源与科研的未来预测
Epoch AI 受 Google DeepMind 委托编写报告,探讨 AI 规模扩张至 2030 年在计算、投资等方面的影响,认为扩张很可能持续,还会加速多领域科学研发,虽预测有不确定性,但 AI 会成关键技术。
一场「狼人杀」,考倒了一堆大模型
南开大学等机构设计 InMind 评测框架,在 Avalon 游戏对 11 个前沿大模型测试。多数模型停留在表层模仿,仅少数推理增强模型有初步‘风格敏感性’,未来人机交互应关注‘像不像’。
使用 Claude Code 自动化 GitHub Actions
这篇技术博客介绍用Claude Code自动化GitHub Actions Runner镜像更新工作,包括用其处理补丁冲突、分析变更,以减少人工工作量,提升开发者生产力,还给出实现细节与代码。
最惨就业季!CS学霸GPA 3.98,投2500份简历仅10次面试,AI吞噬入门级岗位
CS应届学霸Kenneth Kang GPA近满分,海投2500份简历仅获10次面试,其同学还有失业两年未上岸的。AI“夺走”初级岗位,企业偏爱“即插即用”员工,人才培养链断裂,引发技能鸿沟等问题。