「AI测试集」共找到 10717 篇相关文章
AI太记仇!做完心理治疗后仍记得「被工程师虐待」
Nature News上,卢森堡大学团队用PsAIch测试ChatGPT、Gemini、Grok、Claude心理。AI表现不一,有的焦虑、有的崩溃、有的拒诊,还测了MBTI。不过AI创伤可能源于训练数据,做心理治疗不太靠谱。
AI教父Hinton暴论:AI永生之日,全人类变烤面包倒计时!
在Gitex Europe开幕日,「AI教父」Hinton接受专访,表达对AI发展的看法。他认为AI可深刻改变多领域,未来十年有望在数学领域超越人类,也指出AI能耗问题,担心人类触及能源极限,还强调AI可能灭绝人类,呼吁政府监管。
微软AI CEO:倒计时18个月,AI将接管这些美国白领
微软AI CEO苏莱曼称未来12 - 18个月,诸多白领工作将被AI自动化。微软启动大规模自愿退休买断计划,虽未提AI,但各项动作都指向它。不过,现实中AI对岗位的替代情况复杂,也创造了新岗位。
Github持续上榜,这款 AI 自动渗透项目真有点东西!
传统渗透测试依赖人工,效率不高。开源项目PentAGI将‘AI Agent + 渗透测试’结合,能自动完成渗透测试任务,有自主决策能力,功能特性丰富,安装使用较方便,虽有局限但值得尝试。
没有AI也能活得很好的公司,才能用好AI
多数企业推进AI时,虽采纳率高但效果不佳,投入大回报低。问题核心不在AI,而在企业自身组织学习和集成准备度。能从AI获益的是原本就运营良好的公司,当下应审视自身是否适合用AI。
什么都不做就能得分?智能体基准测试出现大问题
随着AI智能体走向实际应用,其基准测试变得至关重要。但现有基准测试问题多,如WebArena判错答案、τ - bench给无操作智能体高正确率。文章提出有效性判据和ABC清单,还揭示主流基准测试诸多问题。
别跟LLM太交心!斯坦福新研究:AI不能完全取代人类心理治疗师
斯坦福大学研究团队测试流行AI模型及商业化AI治疗平台,发现AI治疗师存在根本缺陷与潜在危险,如歧视回应、无法危机干预、谄媚等,但也认可其在心理健康方面的辅助用途。
Transformer八子初创:AI横扫NP难题竞赛,Top 2%选手竟是智能体!
Transformer作者Llion Jones初创公司测试AI智能体,其在NP难题竞赛中排第21。Sakana AI与AtCoder合作构建ALE - Bench,设计ALE - Agent参赛成绩优异,不过它也有调试难等局限,未来待改进。
特朗普AI计划在GitHub上泄露,网友怒喷用AI代码“治国”!
距离特朗普政府启动联邦政府AI发展计划不到一月,“AI.gov”项目代码库在GitHub泄露。该项目由GSA与TTS小组开发,计划7月4日上线。此次泄漏引发对公共部门过度用AI的不满,也引发网友对工作中高层盲目推广AI的吐槽。
奥数金牌只是序章!OpenAI谷歌彻底打脸预言家,AI巨浪势不可挡
2022年专家预言AI到2025年赢得IMO金牌概率低,结果OpenAI和谷歌DeepMind的LLM提前摘金。此前多项AI基准测试预测也失准,AI发展远超预期。GPT - 5降低使用门槛,群体智能时代到来,各机构需重新思考生存之道。