「AI鉴真」共找到 9923 篇相关文章
登上热搜!Prompt不再是AI重点,新热点是Context Engineering
最近「上下文工程」很火,Andrej Karpathy 为其打 Call。它和「提示词工程」不同,是构建自动化系统给模型提供输入。文章介绍了其核心要素、实践方法论,还给出了参考的博客和视频。
紧急加薪+全员放假!OpenAI被连挖8人后,真慌了
面对Meta疯狂挖人,OpenAI本周基本停工,员工放假一周,高管继续工作。首席研究官Mark Chen承诺与Meta交锋,反制措施包括调整薪酬等,还表示公司将改变工作节奏,更专注实现AGI。
推理正确率下降65.5%!斯坦福、MIT等用「不等式」拷问AI逻辑极限
大语言模型在数学证明常现推理漏洞,斯坦福等高校团队提出IneqMath基准评估其严谨性。用不等式证明题切入,拆解为子任务,构建评测体系,用LLM - as - Judge审查。结果显示模型推理正确率低,存在结构性缺陷。
从天价咨询到免费AI,夸克能改变志愿填报这门生意吗?
高考报志愿难题一直存在,天价咨询服务并非人人能享。夸克推出国内首个高考志愿大模型,免费生成志愿报告。它能理解复杂规则、把握考生需求,经多阶段训练优化,还搭载高考知识库,产品体验简便。
一句“Hi”,80$蒸发!O3-Pro:地表最强,也最“坑”的AI!
昨晚ChatGPT宕机,OpenAI 2折甩卖o3模型并发布o3 Pro。o3 Pro编程能力强,达全球top150程序员水准。官方称甩卖的o3是原版但推理快近40%。o3使用成本高,还需足够上下文。
苹果炮轰AI推理遭打脸,GitHub大佬神怒怼!复杂任务≠推理能力
苹果发表论文指出推理大模型存在重大缺陷,相关解读在社交平台广泛传播。但GitHub高级工程师Sean Goedecke对论文持保留态度,认为谜题不是评估推理能力的好试验场,模型放弃不代表无推理能力。
Cursor这波1.0升级,真的要把程序员饭碗摔碎了~
今天Cursor 1.0硬核发布,跨越多个版本。它集成主流MCP、Memory、Agent技术,有BugBot自动代码审查等功能,支持Jupyter Notebook集成,聊天界面体验也更丰富,大幅提升开发生产力。
AI青年学霸齐聚杭州!这场峰会要选出「未来科学新星」
2025年6月6 - 8日,2025全球人工智能技术大会(GAITC 2025)将在杭州召开,多位院士带来重磅演讲。6月7日下午,首届“清源学者”前沿交叉峰会开幕,15位青年学者将分享原创成果,展示人工智能应用潜力。
奖励是假的,能让Qwen提升25%性能却是真的!
华盛顿大学博士生团队用Qwen模型对虚假奖励进行RLVR,使MATH - 500准确率显著提升约25%。研究发现RLVR不考虑奖励正确性,还分析了虚假奖励有效的原因,提示现有研究要在非Qwen模型验证。
一场“直面行业真问题”机器人比赛的万字观赛报告|甲子光年
甲子光年发布ICRA上WBCD赛事观赛报告。该赛聚焦双臂机器人,设生命科学、物流打包、餐桌服务挑战。从实际需求出发,吸引全球团队。各赛展现不同技术亮点,如洛桑联邦理工线控、卡内基梅隆神经 - 符号架构等。