「评分规则」共找到 302 篇相关文章
让代码接管世界演化,西湖大学发布Code视频世界模型
西湖大学研究团队提出 Code World Model,将‘世界如何演化’和‘世界如何被看见’拆成两个互补问题,由 Coding Agent 决定世界演化,代码执行规则,视频模型转化为视觉观察,有应用潜力。
Claude Code 项目初始化模板:黑客松冠军团队的生产级配置
claude-init 是 Claude Code 项目初始化模板,集成黑客松冠军团队生产级配置。有三层文档架构、9 个专用子智能体、10 条快捷指令、8 条强制规则及智能上下文管理,助开发者高效配置使用。
马斯克版微信,终于来了!
4月12日苹果App Store刷出XChat,开发者为X Corp.,将于4月17日上线,中国大陆区也开启预约。它被看作‘马斯克版微信’,无广告、不追踪、全加密,集成AI Grok,或重塑全球社交格局。
TanStack Start 推出导入保护机制,强化服务器与客户端边界划分
TanStack Start引入基于Vite的导入保护功能,防止服务器与客户端代码相互泄露,默认在新项目启用。该功能以插件形式运行,开发和生产环境行为不同,还能添加自定义规则,用户反响积极。
Agent总 “掉链子”?它只是缺这 4 项外挂必备技能
Anthropic工程师团队揭秘给智能体定制技能包,解决现实问题。Anthropic总结智能体在现实任务中目标模糊、步骤混乱等短板,针对性设计任务拆解、状态感知等4大核心技能,让其扎根现实搞定复杂任务。
Gartner发布生成式AI模型提供商魔力象限
Gartner发布《生成式AI模型提供商创新指南》,首次对生成式AI市场进行象限划分,按功能完整性和未来潜力将厂商分为新兴领导者、新兴挑战者、新兴远见者和新兴专家四个区域,还指出AI正从实验转向企业核心层。
AI 模拟消费者,预测购买意图准确率达 90%
PyMC Labs和高露洁棕榄团队研究发现,让大语言模型扮演消费者,用另一AI评分可90%准确预测购买意图,还提出SSR方法。虽有优势,但也面临质疑和局限,可增强市场调研。
The Batch: 979 | LLM 清理智能体的“垃圾”
研究人员提出选择性管理智能体记忆之法,小红书Xubin Hao等构建Self - GC。它在送上下文给LLM前,让大语言模型决定内容取舍。测试显示其删历史少且保留必要细节能力强,不过未测其输出质量。
33.5k星星爆火!这个开源插件让AI不再写屎山,token自然就省下来了
Ponytail是开源插件,将资深工程师工程直觉整理成skill规则,供Claude Code等AI coding agent加载。它让AI开发更克制,减少代码量、成本,提升速度,核心是强制AI做复杂度判断。
Harness Engineering:耗时一周,我是如何将应用的AI Coding率提升至90%的
文章结合Anthropic、OpenAI方法论与项目实践,分享为存量Java应用构建Harness体系,将AI代码率从不到25%提至90%的方法。介绍Harness概念、现状挑战、实战步骤、关键经验及效果,还对其未来发展做了展望。