「零样本扩展」共找到 913 篇相关文章
RAG搜对了却答错?德国萨尔大学找到了真相丨ACL'26
RAG已成大模型落地标配技术,但存在搜到对的文档、模型答案却离谱的痛点。德国萨尔大学等组成的团队诊断出问题在阅读理解,提出Disco - RAG框架,在“搜”和“答”间加“读懂”环节,已被ACL 2026主会录用。
北大联合Llama-Factory推出DataFlex:工业级数据动态训练系统
北大张文涛教授、鄂维南院士团队联合多机构推出大模型数据中心动态训练框架DataFlex。它是统一训练基础设施,纳入三类核心能力,解决底层系统问题,在效率和效果上有提升,受社区认可。
Claude 或将推出 App Builder 功能,打造新的 App Store
Anthropic或为Claude推出App Builder功能,用户能从零构建全栈应用。此前Anthropic已从工具向平台转型,而OpenAI的GPT Store尝试失败,App Builder若成功,Claude将成新应用分发入口。
奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶
当地时间凌晨3:45,OpenAI CEO奥特曼家中遭20岁男子投掷燃烧瓶,嫌疑人已被捕。奥特曼发文报平安,还分享家人照片,同时写下对AI行业现状思考及与马斯克等冲突的反思。
告别噪声初始化:NTU MARS Lab提出A2A新范式,实现机器人高性能单步动作生成
新加坡南洋理工大学 MARS Lab 提出 Action-to-Action (A2A) Flow Matching 新范式,以历史机器人轨迹为生成起点,打破生成速度与精度瓶颈,在训练效率、推理速度及泛化表现上佳,还可扩展至视频生成领域。
The Batch:924|GPT-5.4:性能更高,价格也更高
OpenAI更新旗舰模型GPT-5.4,有Thinking和Pro两个版本,扩展工具使用能力,多基准测试达当前先进水平,但定价高。虽在部分任务表现超Claude,挑战Gemini地位,不过成本也更高。
拒绝Vibe Coding!大神揭秘8套AI编程模式
Datasette创始人Simon Willison公开指南,教专业开发者用Claude Code等AI编程工具提效,总结8大实战模式重构程序员工作方式。还提出认知债务概念,Hacker News对此有不同观点。
OpenAI 开发者的 Skill 经验:如何使用评估系统来优化 Skill
文章聚焦 OpenAI 开发者优化 Skill 的方法,指出迭代 AI 技能效果难测,可借助评估系统。介绍了用 Codex 评估的流程,包括明确标准、创建技能、手动触发找漏洞等,还提及不同阶段的评估重点和工具。
灵码+Qwen3-Coder——使用Skill机制实现代码审核
本文探讨在灵码内使用Claude Skills能力,介绍其实现机制、灵码适配方案。还以代码审核场景为例,展示自定义Skill的创建方法,总结Claude Skills优势及应用场景,展望其与MCP的发展前景。
硅基文明登场!从Clawdbot到Moltbook,人类退居观众席
文章指出AI正自我进化,如Claude Code能自我改进与扩展,Claude Cowork诞生速度惊人。Clawdbot有自主权与记忆,Moltbook中AI形成社会结构。权力正从人类迁移,人类或退居观众席,需思考应对。