「员工绩效评估」共找到 1078 篇相关文章
毕马威:企业对AI Agent智能体试点应用猛增
毕马威2025年一季度AI应用报告显示,企业对AI Agent智能体试点应用猛增,自上季度以来试点企业比例从37%升至65%,在各业务场景广泛探索,但应用中面临员工培训难题,企业也采取了风险缓解措施。
多模态长文本理解测评首发:46款模型无一攻克128K难关
香港科大等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5大类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。
OpenAI开除内鬼!拿着改变世界的机密去赌博,一夜狂赚几十万
OpenAI开除一名利用公司核心机密在预测市场下注牟利的员工。调查发现过去一年多,60个神秘钱包做出77次精准押注。不止OpenAI,其他预测市场平台也出现内幕交易案件,平台陷入尴尬处境。
斯坦福临床医疗AI横评,DeepSeek把谷歌OpenAI都秒了
斯坦福最新大模型医疗任务评测,构建含35个基准测试的MedHELM综合评估框架。结果显示,DeepSeek R1以66%胜率领先,o3 - mini等模型也各有表现,还分析了成本效益。
刚刚,大模型棋王诞生!40轮血战,OpenAI o3豪夺第一,人类大师地位不保?
国际象棋积分赛成果出炉,OpenAI o3以人类等效Elo 1685分夺冠,Grok 4和Gemini 2.5 Pro紧随其后。Kaggle发布国际象棋文本排行榜,评估模型战略推理等能力,还推出相关数据集,虽有局限但意义重大。
被曝蒸馏DeepSeek还造假!欧版OpenAI塌房了
被誉为欧洲版OpenAI的Mistral被离职员工爆料多项黑幕,其最新模型疑似直接蒸馏自DeepSeek,却包装成RL成功案例,歪曲基准测试结果。此前就有人发现其模型与DeepSeek相似,目前官方暂无回应。
利用大模型从开源情报中自动提取检测规则:LLMCloudHunter,有开源
随着网络攻击增加,威胁情报成主动安全关键。以色列本古里安大学发布LLMCloudHunter框架,用大模型从开源情报自动生成检测规则,评估显示其规则质量高,且大部分能编译成Splunk查询,软件已开源。
Replit 怒锤“欧洲版 Cursor”:造出百款“高危”应用,普通开发者一小时内黑入,氛围编码成了黑客“天堂”?
近日,Replit 员工报告 Lovable 未修复关键安全漏洞,扫描发现其百款应用高危,普通开发者一小时内可黑入。Lovable 虽推出‘安全扫描’功能,但仍未解决底层问题,引发对氛围编码安全责任的讨论。
ICML 2025 Spotlight | 谁导致了多智能体系统的失败?首个「自动化失败归因」研究出炉
ICML 2025 Spotlight 论文提出「自动化失败归因」新方向,应对多智能体系统失败难诊断问题。构建「Who&When」基准数据集,设计三种初步方法并评估,虽现有方法表现有限,但此研究意义重大,有望助力打造更可靠系统。
Claude深夜彻底「虾化」!一句话接管电脑打工,手机指挥7×24小时不停
Claude获批全自主接管全球打工人的电脑,能自主访问并操作各类软件。只需手机发指令,它就能干活。Anthropic还在研发手机使用功能,敲/schedule命令能让Claude定时工作,成全天候员工。