「结构化评估」共找到 1779 篇相关文章
让思考更准更长!强化学习新算法FIPO来了
阿里通义实验室Qwen Pilot团队发布系列博客剖析大模型强化学习机制与局限,推出新算法FIPO。该算法引入Future - KL机制,解决‘推理长度停滞’问题,在多项测试表现优异,还介绍招聘信息。
卡帕西没做完的,开源社区48小时搞定了!完全体知识库,token省70倍
Karpathy分享的个人知识库爆火,48小时后开源社区推出Graphify工具。它零配置、全模态、本地跑,能自动构建知识图谱,省71.5倍token,还全平台适配,降低了上手门槛。
Harness Engineering 的防御视角:从 Codex Security 看 AI 生成代码的治理
作者用 Codex Security 分析项目,发现它不仅列漏洞,还提供攻击路径等。AI 没创造新漏洞,却放大缺陷,需新方式治理大规模自动生成代码,Harness Engineering 有防御价值。
AI编程的下半场来了?学会用Agent Skill解决编程的痛点问题
文章分享用 Agent Skill 解决 AI Coding 痛点的实操复盘,如让代码上线、解决 AI 不用 Skill 问题。介绍 Skills 原理、CloudBase Skills 优势及与 MCP 组合,还给出实战案例、踩坑经验和未来规划。
前端开的同学,天塌啦,AI把前端开发最后一公里给补上啦,不敢相信,太夸张啦~~~
Vercel Labs 开源的 agent - browser,是面向 AI Agent 的无头浏览器自动化 CLI。它解决了 AI 前端开发缺真实浏览器验证交互的问题,适用于多场景,有诸多对 AI 友好的特性,还介绍了使用方式。
迎接「万物皆可RAG」时代:最新综述展示50多种多模态组合的巨大待探索空间
大模型常采用RAG技术,多模态崛起使RAG向MM - RAG发展。目前MM - RAG研究初级,华中科技大学等研究者发布综述,覆盖所有模态组合,剖析工作流,提供构建系统的一站式指南。
Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识
Meta推出「自由Transformer」新模型,打破自2017年以来GPT模型核心规则,在解码器引入潜在随机变量Z,增加“潜意识”。仅增约3%计算开销,在多测试中超越大规模模型,或开启后自回归时代。
攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产
新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。
6K+ star神器!Docker也能跑桌面了,安全隔离还能硬件加速,太绝了!
文章介绍开源工具`x11docker`,它专为 Docker、podman 等设计,能让图形应用在容器正常运行,增强隔离性、避免安全隐患。该项目获 6K+ Star,功能丰富,安装使用简单。
谷歌发布首个AI+教育RCT实验,传统教材要凉?
谷歌论文提出Learn Your Way AI增强型教科书系统,有两阶段AI生成框架,构建完整学习体验。经专家评审和RCT证明,使用该系统的学生学习效果和体验更好,还介绍了其可用场景。