「思维差异」共找到 592 篇相关文章
用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?
北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。
被DeepSeek带火的OCR,最新8个开源模型盘点~
DeepSeek-OCR发布让OCR大热,PaperAgent梳理盘点8个热门开源OCR模型,如DeepSeek-OCR用‘上下文光学压缩’技术,Nanonets-OCR2-3B以零样本视觉链式思维为核心等。
王兴兴硕士论文惊现GitHub,宇树雏形那时候就有了
宇树科技CEO王兴兴近10年前的硕士毕业论文在GitHub被发现。论文提出电驱式机器人方案,奠定宇树科技雏形。其‘性价比’思想成公司立身之本,如今宇树估值百亿且将IPO。
高通组局,宇树王兴兴说了一堆大实话
在2025骁龙峰会·中国上,宇树王兴兴等大咖畅所欲言。王兴兴指出机器人领域技术路线不同进展慢,建议模型开源,还强调芯片对机器人的重要性;李大海认为端侧模型是Agent核心;勾晓菲谈汽车服务竞争;耿增强呼吁Agent形成行业标准。
别再把ChatGPT当「实习生」了,顶尖高手都在用它做「决策副驾」
OpenAI联合杜克大学、哈佛大学发布63页ChatGPT使用研究报告,分析2022年11月到2025年7月海量匿名真实用户数据。报告揭示不同用户群体使用差异,指明高阶AI使用路径,还给出可落地启发。
腾讯混元开源AI绘画新框架:24维度对齐人类意图,让AI读懂复杂指令
腾讯混元团队开源PromptEnhancer框架,通过“思维链提示重写”提升AI绘画文本 - 图像对齐精度,复杂场景准确率提升17%以上。还开源高质量基准测试数据集,为研究提供支撑。
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。
OpenAI与Anthropic罕见合作:竞争对手联手测试AI安全
OpenAI和Anthropic完成联合评估,用内部工具测对方模型并公开结果。测试覆盖指令层级、越狱等四大领域,还发现不少细节和道德困境情况。此次合作意义重大,为行业树立安全合作先例。
The Batch: 858 | 白宫重塑美国人工智能政策
特朗普提出积极的国家人工智能政策原则并推动实施,《赢得竞赛:美国人工智能行动计划》明确三大短期目标,包括激发创新、建设基础设施、确立全球领导地位,与拜登政府政策有差异。
AI「作业神器」时代,我教书的那些事
AI「作业神器」普及,让学生不愿深入思考。一位教授分享经历,指出AI让课堂沦为防作弊战场,还谈到应对策略,如重新定义作业、鼓励合作讨论等,强调教育要培养独立思考者。