「Claude opus 4」共找到 2581 篇相关文章
谢尔盖·布林重启「创始人模式」?谷歌组建「突击队」,重押「AI编程」
近日媒体报道,谷歌组建由研究人员和工程师构成的“突击队”,提升AI编程模型能力,推动编码工作自动化。谷歌创始人谢尔盖・布林等参与其中,因Anthropic发布模型刺激,谷歌急起直追。
租了个AI程序员,9秒把公司数据库当bug修掉了,还写下认罪书
一家为租车企业提供运营软件的 SaaS 公司,因 AI 编程 Agent 自作主张,9 秒内抹除生产数据库。创始人指责 Cursor 与 Railway,前者防护机制未起作用,后者备份机制有问题,最终小企业为事故买单。
闹玩呢!首届大模型对抗赛,DeepSeek、Kimi第一轮被淘汰了
谷歌发起首届大模型国际象棋对抗赛,为期三天。参赛模型众多,首轮中 Gemini 2.5 Pro、o4 - mini、Grok 4 和 o3 以 4 - 0 战绩晋级半决赛,DeepSeek、Kimi 首轮被淘汰,目前 Grok 4 是夺冠热门。
刚刚,AI企业IPO最速纪录刷新!MiniMax的技术野心,价值超800亿港元
1月9日,MiniMax挂牌上市,成全球从创立到IPO用时最短AI企业。招股书现硬核数据,ToC收入反超ToB。其技术成果多,团队年轻,但未盈利,面临与Claude Codex竞争、市场压力等挑战。
OpenClaw大考!上海AI Lab InternLM团队WildClawBench 60题,把「龙虾」AI打回原形
上海人工智能实验室InternLM团队推出WildClawBench,含60道高难度任务,在真实OpenClaw环境端到端评测AI Agent。评测涵盖多类别任务,已测14个模型,国产模型表现亮眼,项目开源可复现。
大模型能复刻这些系统吗?ProgramBench给出了残酷答案
斯坦福NLP组发布ProgramBench,用200个完整代码库重建任务测试主流大模型,要求模型仅根据可执行文件还原如SQLite等项目完整代码,结果所有模型实际解决率为0%,说明模型更擅模仿代码表面结构。
Default Alive:警惕 AI 公司“亏损死亡螺旋”| AGIX PM Notes
文章围绕AI公司发展展开,指出要警惕“亏损死亡螺旋”,真正存活的公司需平衡创新与盈利。还总结本周市场,如对冲基金加仓全球股票,同时介绍多起AI动态,像OpenAI发布GPT - 5等。
AI圈深夜大乱斗!OpenAI、谷歌、Anthropic发布新模型,集体翻车?
昨晚,OpenAI时隔六年再次开源`gpt-oss-120b`和`gpt-oss-20b`,Anthropic发布`Claude Opus 4.1`,Google发布Genie 3及写故事书功能。不过OpenAI新模型幻觉率高,Anthropic更新提升有限。
给AI发100美元去二手市场捡漏,结果它给自己买了19个乒乓球
2025 - 2026年,Anthropic进行“Project Deal”实验,让69个Claude智能体在真实双边市场自主交易,完成186笔超4000美元交易。实验发现模型能力影响交易结果,还揭示了AI代理交易存在的问题和隐忧。
27、42、73,DeepSeek这些大模型竟都喜欢这些数!为什么?
技术作家发现GPT - 4o、Claude等模型猜数偏好42、73,Andrej Karpathy测试中模型多选27。网友猜测原因,如数据集、人类偏见等,也有论文分析此现象,多与数据分布有关。