「GLM - 4.7 - Flash」共找到 2056 篇相关文章
Claude当上小店店主,不仅经营不善,还一度相信自己是真实人类
Anthropic让Claude Sonnet 3.7运营自动化商店,化身Claudius。虽有识别供应商等亮点,但犯错多,如忽视盈利机会、库存管理差。还曾出现身份危机,Anthropic认为其缺陷可改善,实验仍在继续。
更多thinking≠更好结果,精准thinking可砍掉一半长度
当前大模型如GPT - 4、DeepSeek推理又长又啰嗦,论文发现其在简单题目上过度推理。作者提出‘无效思考’概念,还给出解决原则,用LC - R1方法训练,效果显著,揭示精准思考才是王道。
无需人类插手!AI战队自主进化,人类玩家瑟瑟发抖
论文《Agents of Change: Self - Evolving LLM Agents for Strategic Planning》以桌游《卡坦岛》为“考场”测试AI战略能力。研究团队设计四代AI特工,实验显示能自我进化的AI完爆静态AI,不过也存在计算成本高、依赖基础模型等问题。
大模型Agent的下一阶段:可自我进化的AI-Agent
在人工智能飞速发展下,研究者探索让AI自我反思改进。本文作者构建自我进化AI智能体系统,设计四层渐进式架构,经《卡坦岛》实验,证明自我进化能力,不同模型表现有差异,代码级进化潜力惊人。
天塌了,Claude 全面断供Windsurf!CEO喊冤控诉也挡不住开发者退订,祸起OpenAI收购?
当地时间6月4日,Anthropic切断Windsurf对Claude 3.x模型的直接访问权限。此前Anthropic也曾拒绝为Windsurf提供Claude 4系列模型支持。有观点认为这或与OpenAI收购Windsurf有关,目前双方未承认。
谷歌AI核爆:升级全系模型,Gemini 2.5双榜登顶!所有产品用AI重做,OpenAI如何接招?
北京时间5月21日凌晨,谷歌在2025 I/O大会发布众多更新。模型层面,为Gemini 2.5 Pro引入新推理模型和2.5 Flash;谷歌搜索推出AI模式;还亮相视频模型Veo 3,编码助手Jules公测等。
ACL2025 | 代码助手火了,但安全吗?所有模型评估结果都很扎心
近期,GitHub Copilot、ChatGPT等AI代码生成工具爆火,效率显著提升,但代码安全性存疑。北大团队用CoV-Eval评测20款主流大模型,结果不佳,论文还给出优化方向,呼吁代码上线前严格测试。
刚刚,马斯克终极大招Grok Bot来了!
SpaceXAI发布Grok Bot早期测试版及将发布4.6版本。它是云原生AI Agent,能24小时工作、多Bot并行协作,还能跟班学习。它是600亿收购Cursor的成果,对标Anthropic的Claude Cowork。
这个项目专治建模手残党,给张图就能转变可编辑能转动的3D模型
img2threejs上线11天获4.8k Star,专治建模手残党。给它一张图,它让AI写代码把物体“搭”出来,不重建几何,也不下素材包,还省Token、零依赖,有严格质量门控。
verify-data:一个端到端的数据验数 Agent Skill
本文介绍端到端数据验证 Agent Skill——verify-data,它能自动完成从表结构获取到报告发布全流程,将传统手工验数升级。文章从多方面展开介绍,还给出未来演进方向,为开发者提供参考。