「程序验证」共找到 1007 篇相关文章
体验完微信Agent以后,我觉得这就是微信有史以来最大的更新。
作者获微信小微内测资格,深度体验后认为这是微信最大更新。微信Agent打通原生能力有超预期之处,但智能程度不足。功能上有亮点也有限制,如通讯录操作谨慎、小程序适配佳,还能生成小工具。
o1 核心作者 Jason Wei:理解 2025 年 AI 进展的三种关键思路
前OpenAI核心研究员Jason Wei跳槽Meta后,在斯坦福大学AI Club演讲,提出理解2025年AI发展的三个核心思想:验证者定律、智能的锯齿状边缘和智能商品化。他认为AI将解决可验证任务,智能成本会趋近零,且各任务发展不均衡。
GLM-4.5 验证:智谱已完成一轮“洗牌”
2025年大模型热度下降,智谱AI关注度降低。7月28日晚其发布新一代基础模型GLM - 4.5,体现战略调整成效。该模型专为AI Agent打造,性能出色,同时智谱人事、业务、收入等方面也有“洗牌”。
关键突破:理论验证了 RL for LLM 路线的可行性
传统RLHF依赖人工标注偏好数据训练奖励模型,成本高且难扩展。本文发现任何通过Next - token预测训练的LLM内部隐含通用奖励模型,从理论和实验证明其可高效实现模型对齐。
解密 Cursor:一位深度用户的原理探析与实验验证
文章作者作为 Cursor 付费用户,通过实验分析其与大模型通信机制和设计原理。用 OpenAI 的`gpt - 4o`模型做实验,发现它是‘基模 + 若干工具’组合,也指出在真实项目因上下文不足表现不佳。
谷歌偷偷上线免费Cursor,程序员饭碗又摔碎了!
Google AI Studio增加build按钮,相当于免费的cursor。能用一句话、图或文件生成完整AI应用并一键部署。可通过对话修改应用,分享应用消耗他人免费配额,利于推广Gemini生态。
不卷速度卷验证,陈天桥MiroMind精准预测15天后黄金价格
陈天桥带队的MiroMind发布新一代重型推理智能体MiroThinker-1.7和MiroThinker-H1,在基准测试中表现优异,超越众多顶尖模型。该模型不仅通用任务强,在科技金融等专业领域也表现亮眼,还能承担真实长链条智力任务。
从平面几何出发:形式化验证如何驱动MLLM的推理能力跃迁
多模态大语言模型在复杂数学与几何推理中有缺陷,现有训练方式让模型难有鲁棒推理能力。上海交大等团队提出“以形式化增强非形式化推理”方案,构建完整闭环,提升模型推理及泛化能力。
硅谷爆发反AI「起义」!程序员拒用Cursor被一周解雇
AI席卷职场,大厂裁员与岗位替代加速。奥特曼称能被AI取代的工作并非「真工作」。硅谷上演「代码战争」,有人拥抱Cursor/Claude提效,有人拒用AI遭解雇,人类价值与工作定义正被重写。
刚刚开源不到1MB大小,每个AI程序员都该装!
当跑多个 AI Agent 时,很难第一时间了解每个 AI 状态。刚开源的 `abtop` 项目运行在终端,能实时展示 Claude 和 Codex 会话状态,不依赖 API Key,功能实用且安装方便。