「安全评估」共找到 1558 篇相关文章
工具增强的多模态LLM综述
多模态大语言模型(如GPT - 4V)虽有强大图文理解能力,但受数据稀缺、复杂任务表现不佳和评估标准不统一限制。论文提出为MLLM集成外部工具,构建全景图,覆盖多维度,还指出挑战与对策。
同一天,Cursor、ClaudeCode都把 Agent 的手脚伸进了你的内网
9月2、3日,Cursor和Claude Code分别发布功能,让AI Agent工具执行跑在用户网络而非云上,解决企业代码不出内网痛点。这标志AI编程工具进入to B基础设施之争,不过要关注安全信任问题。
开源中小模型+Skills也性能暴增!卢森堡大学探索了小模型驾驭Skills的边界
卢森堡大学等研究探索小模型驾驭Skills的边界。工业界因数据安全渴望开源小模型,智能体Skills框架让小模型性能暴增。研究拆解小模型处理复杂任务的方法,还验证不同策略有效性,发现代码专用模型优势。
AI里最大的Bug,却也是人类文明最伟大的起点。
OpenAI论文指出AI产生幻觉是因其训练方式奖励瞎蒙行为。以考试为例,AI在信息不足时猜测是最优策略。还从统计学解释根源,指出解决幻觉需改变评估指标,也引发对人类想象力起源的思考。
金融智能体真的是大模型落地“最后一公里”?
InfoQ《极客有约》X AICon 直播栏目邀请业内人士探讨金融 AI 大模型实践现状。指出大小模型融合是主要方案,智能体有应用但也有问题。还分享了评估 AI 项目的要点、智能体应用案例及未来布局方向。
终于!OpenAI 开源了2款模型:gpt-oss-120b 和 gpt-oss-20b
OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 开源模型,性能出色,如 120b 版本媲美 o4-mini,20b 版本能在笔记本甚至手机运行。采用 Apache 2.0 许可证,有多种特性与运行方式,还经安全分析。
Container Use:一种用于独立的并行编码代理的新工具
Dagger团队发布开源工具Container Use,为AI编码代理提供容器化沙箱和Git工作树,实现无冲突并行工作流。它能创建隔离开发环境,让开发者在同一代码库安全运行多代理。不过该工具尚处早期,有不足。此外还介绍了其他类似工具。
烧钱,能解决 AI 存储的焦虑吗?
存储短缺焦虑或延续至 2026 年,传统云存储因 AI 落地面临性能、成本等压力。InfoQ 联合腾讯云邀行业人士探讨成因、策略与竞争主线,还给出存储价值评估与规划方法,介绍文远知行和腾讯云实践。
深度讨论 Online Learning :99 条思考读懂 LLM 下一个核心范式|Best Ideas
文章围绕Online Learning展开深度讨论,指出其或为LLM下一个核心范式。探讨了它是通往更高层次智能的关键路径,分析概念定义、非共识,还阐述做好它的方法,以及架构、算力和评估范式等问题。
联合理解生成的关键拼图?腾讯发布X-Omini:强化学习让离散自回归生成方法重焕生机,轻松渲染长文本图像
图像生成领域,自回归与扩散模型技术路线之争不断。腾讯混元团队发布X-Omni模型,通过强化学习提升自回归图像生成质量,能渲染长文本图像。该模型已开源,还构建奖励系统评估生成质量。