「任务酒馆模式」共找到 2771 篇相关文章
Claude Code 学习最佳实践:NotebookLM 生成全套学习视频+卡片+测试题
文章介绍用NotebookLM学习Claude Code的最佳实践。有人将36篇Claude Code资料“喂”给它,生成含音视频的学习资料库。NotebookLM能多种形式输出,支持多类型输入,值得纳入日常工作流。
V4或Code要来?刚刚,DeepSeek-V3.1-Terminus发布!
DeepSeek线上模型升级为DeepSeek-V3.1-Terminus,单从名字看像是V3终极版,或在筹备V4及Code模型。deepseek - chat和deepseek - reasoner完成升级,此次更新改进语言一致性,优化Agent能力。
34k star!开源多层级自主协作AI Agent,超10万开发者认证
CrewAI是超34000颗星的开源AI Agent框架,曾获Github每日增长趋势第一。基于Python,核心架构由CrewAI Crews和CrewAI Flows组成,设计灵感源于人类协作,已有超10万开发者认证。
Nature:博士太多,高校已经装不下了!
过去几十年全球博士毕业生数量爆炸式增长,远超学术界职位空缺。如今就业从学术界转向工业界,未来博士教育培养模式应转变,产学研结合,以匹配劳动力市场。
OpenAI获五角大楼2亿美元订单,迈向军工领域
OpenAI推出“OpenAI for Government”计划,为美国政府提供AI工具。首个合作是与五角大楼的试点项目,合同上限2亿美元,用于变革行政运营,州和联邦层面已有应用实例。
智能体自己出现问题自己找!首次提出“自动化失败归因”课题 | ICML2025 Spotlight
LLM Multi - Agent系统失败诊断难,阻碍迭代优化。宾夕法尼亚州立大学等机构研究者首次提出“自动化失败归因”课题,构建Who&When数据集,开发评估多种归因方法,实验揭示当前方法不足。
北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师
北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。
视频生成1.3B碾压14B、图像生成直逼GPT-4o!港科&快手开源测试时扩展新范式
香港科技大学联合快手可灵团队推出 EvoSearch 方法,支持图像和视频生成。该方法无需训练和梯度更新,能提升模型生成质量,展现了 test - time scaling 补充 training - time scaling 的潜力,目前论文和代码已开源。
实测腾讯Hunyuan-Image2.0,首个毫秒级实时图像生成模型
今天上午腾讯发布混元图像2.0,以“更智能、更开放、更中国”为理念。其参数规模提升,推理时间大幅压缩,实现毫秒级实时生成,还在画面质量等方面升级,新增实时绘画板功能。
模型不是企业的护城河,那什么才是?
文章指出企业AI进入深水区后,真正的竞争是将AI变成企业自己的智能引擎。衔远科技创始人周伯文提出泛化基础上的深度专业化是企业竞争力来源。衔远发布EnterpriseClawBench,揭示企业需私有化评估和可持续进化能力。