「技能差距」共找到 570 篇相关文章
Karpathy:写了20年代码,现在像作弊
Karpathy曾造词“vibe coding”,一年后弃用。他开源autoresearch项目,让AI Agent自主跑实验,自己不写代码。他还展示家庭监控分析系统也由Agent完成。他提出“agentic engineering”,认为工具虽变,但深度技术专长更重要。
Google开源Workspace CLI,让AI在终端操作办公全家桶
Google开源Workspace CLI项目,把全套办公工具装进命令行。它动态构建命令结构,输出为结构化JSON。内置超100个Agent Skills,支持多MCP客户端,认证灵活,还集成Gemini CLI扩展。
Google说,2026年AI Agent会有这五大趋势!
Google Cloud发布2026年Agent趋势报告,认为能改变业务的转折点是Agentic AI,总结了五大趋势,如人人都有Agent、流程自动化等,核心是让员工成Agent管理者和协调者。
复读一年,AI 把高考数学成绩从及格线提到 145 分!AI 数学能力发生了什么?
今年媒体让AI做高考数学题,Gemini 2.5 Pro获145分排第一。从去年到今年,AI数学能力指数级增长,这得益于推理模型。推理模型用思维链和强化学习解题,未来高考数学或难区分模型能力。
33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形
ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。
AI 会取代你的工作吗?Anthropic 用 200 万对话告诉你答案
Anthropic发布Economic Index第四期报告,分析200万次Claude对话,提出“经济原语”框架。发现AI对高学历任务加速效果更好但成功率低,还揭示Claude.ai与API差异,引入“有效AI覆盖率”等。
月薪 3500 的 “机器人保姆” 来了!OpenAI 投资的家用人形机器人开售,AI 是核心驱动力
10月28日,OpenAI投资的1X Technologies推出的家用人形机器人NEO开售,早鸟价20000美元/台,也可月租。它硬件出色、AI驱动,能对话、处理家务并持续学习,核心是升级的硬件平台。
Common调查数据,72%美国青少年使用过AI伴侣
美国非营利组织Common Sense Media研究显示,72%美国青少年至少试过一次AI伴侣,52%为定期用户。研究还考察了使用行为、原因、感受等,如近半视其为工具,50%不信任其信息。
Karpathy提的“软件3.0”已过时,交互即智能才是未来 | 上交大&创智刘鹏飞
上海交通大学刘鹏飞团队认为,2024年9月后,大神Karpathy提出的“软件3.0”已过时,“软件3.5”应运而生。其核心是“交互即智能”,在自然语言易用性基础上实现人机交互认知层面突破。
EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?
随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。