「漏洞发现」共找到 1146 篇相关文章
黎曼猜想推至理论边界99.55%!元代理架构AI:在思考中重塑大脑
科学家面临让AI解决复杂科学难题的问题,传统固定架构AI处理特定复杂问题不顺手。近日学术团队提出Eureka架构,能让AI动态“生长”专用“大脑”,在测试中表现出色,还在数学和物理领域有重大成果。
深入原子世界,他在寻找材料失效的原因
文章介绍了美国宾夕法尼亚州立大学副教授杨洋的材料研究。他利用先进电子显微技术,研究材料在极端环境下微观过程,如空位、虫洞腐蚀和短程有序,旨在理解材料失效机制,推动材料设计优化。
Transformer祖传设计遭暴击,COLM顶会三篇论文发难
COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。
实测吓一跳,gpt-5.6居然比deepseek flash还便宜
上周GPT-5.6 luna打2折,次日梁圣的v4flash正式版发布。经实测,把GPT薅到极致比DeepSeek便宜,还整出无限活力流玩法。Luna max智力分值超Sol high,虽耗时久但成本低。
OpenAI 全面拥抱 Agentic-First,实测有点扎心
OpenAI发布GPT - 5.6系列,Sol定位长周期Agent,训练目标转向Agentic - First。但目前难以用上Sol,且其评测数据因计数规则差异大,还出现变身话痨、少说话和干完活难兼顾的问题。
很多人没有意识到:靠自己实践出来的信息是非常值钱的
现在有了AI,大家普遍觉得信息差被缩小,但作者认为靠自己实践得到的信息仍最值钱,AI暂时替代不了。作者通过去咖啡馆、使用AI模型集合网站、上班等例子说明实践获信息的重要性。
AI 写代码太快,人类测试跟不上了,Meta 用新方法把 bug 检出率提升 4 倍
Meta 用即时(JiT)测试方法提升软件质量,该方法在代码评审期间动态生成测试,在 AI 辅助开发环境中将缺陷检测能力提升约 4 倍,源于代理式工作流兴起及传统测试套件的局限。
一种可以减少 CI 回归测试套件规模的更佳方案
作者作为测试架构师,认为减少CI回归测试套件规模理论诱人但实践常失望。介绍有效处理大型测试套件的方案,如随机趋势分析、多上下文模式匹配等,还谈及无门控测试等优势,能助力管理测试集。
达尔文.skill正式发布,一个无限进化的skill系统!
作者受Karpathy的autoresearch启发,开发了达尔文.skill系统,可自动评估和优化skill。它有五条原则、八维度评分体系,能批量解决skill质量问题,与Anthropic官方工具互补,现已开源。
Anthropic的疯狂一周:每天一个新产品,我已经跟不上了
4月4 - 9日,Anthropic动作不断,先封杀第三方Agent用Claude订阅额度,又发布Claude Mythos Preview、Claude Managed Agents和Advisor Tool。其Agent产品线分三层,还展现“不发布”策略,背后是控制生态的商业考量。