「赋能增值」共找到 5045 篇相关文章
支持中文!NotebookLM自动生成播客
Google宣布NotebookLM语言摘要功能支持50多种语言,包括中文,可将上传文档转成播客对话形式。以一篇AI进化论文为例展示效果,其音频和内容质量不错,学习输入立体,还能助力AI播客创作。
让大模型“吃一堑长一智”,南理工百度等提出模型记忆新方法
南京理工大学联合百度等提出新方法ViLoMem,构建视觉流+逻辑流的双流语义记忆,让模型“从错误中学习”。它能在多模态基准提升模型表现,强模型记忆还可迁移给小模型。
黎曼猜想推至理论边界99.55%!元代理架构AI:在思考中重塑大脑
科学家面临让AI解决复杂科学难题的问题,传统固定架构AI处理特定复杂问题不顺手。近日学术团队提出Eureka架构,能让AI动态“生长”专用“大脑”,在测试中表现出色,还在数学和物理领域有重大成果。
一种可以减少 CI 回归测试套件规模的更佳方案
作者作为测试架构师,认为减少CI回归测试套件规模理论诱人但实践常失望。介绍有效处理大型测试套件的方案,如随机趋势分析、多上下文模式匹配等,还谈及无门控测试等优势,能助力管理测试集。
4.5k星星爆火!用图片压缩Fable 5上下文,成本大幅降低,终于用得起这个模型了
Fable 5在AI圈爆火,但使用成本比其他型号贵至少5倍。pxpipe项目把适合压缩的大段文本渲染成PNG图片,交给多模态模型读取,能大幅降低成本,还能增加上下文长度。
把任何文档变成Claude的新技能,这个开源工具火了。
Claude新出Skills,类似插件让其有自定义可调用功能。开源工具Skill Seekers能把网站文档转换成可使用技能。介绍了Skills特点及Skill Seekers功能原理、特点等,效率提升显著。
马斯克偷偷憋了个大招!Grok秒出《阿凡达》画质,好莱坞瑟瑟发抖?
马斯克又放大招,Grok即将推出「Imagine」视频功能,能加音效、配画面,支持多风格生成,可把图像转换为视频。它挑战谷歌Veo 3,生成速度快,操作体验好,还支持多方式创作。
170次搜索+50次反思:用GLM-4.7盘点2025 Agent行业趋势,结果太震撼!
作者给智谱新开源的GLM - 4.7布置调研2025年Agent赛道企业的任务,结果令人震撼。该模型进化显著,能整理详细企业信息,还能生成高审美PPT。国内有不少特色AI落地企业。
PDF/DOCX/HTML/扫描文档接卸不再愁!D自动解析文档并统一格式的开源库edoc
Dedoc是开放通用系统,能将文档转换为统一格式,提取逻辑结构和内容。用Python实现,支持多种格式,有可扩展性等优势,还能处理扫描文档,可用于多个系统,介绍了安装方法。
3.2K Star!这个开源字幕神器,对剪视频的创作者来说,救了大命!
视频创作中字幕制作耗时费力,剪映等工具各有局限。开源字幕工具 AutoSubs 能有效解决痛点,可一键生成高质量字幕、自动区分说话人,本地运行保障隐私,还具备多种亮点功能,使用简单。