链载Ai

标题: B 站基于大模型的大数据智能诊断助手实践 [打印本页]

作者: 链载Ai    时间: 昨天 22:22
标题: B 站基于大模型的大数据智能诊断助手实践


ingFang SC", system-ui, -apple-system, BlinkMacSystemFont, "Helvetica Neue", "Hiragino Sans GB", "Microsoft YaHei UI", "Microsoft YaHei", Arial, sans-serif;font-size: 17px;font-style: normal;font-variant-ligatures: normal;font-variant-caps: normal;font-weight: 400;letter-spacing: 0.544px;orphans: 2;text-indent: 0px;text-transform: none;widows: 2;word-spacing: 0px;-webkit-text-stroke-width: 0px;white-space: normal;background-color: rgb(255, 255, 255);text-decoration-thickness: initial;text-decoration-style: initial;text-decoration-color: initial;text-align: center;line-height: 2em;">01

背景介绍


ingFang SC", system-ui, -apple-system, BlinkMacSystemFont, "Helvetica Neue", "Hiragino Sans GB", "Microsoft YaHei UI", "Microsoft YaHei", Arial, sans-serif;font-size: 17px;font-style: normal;font-variant-ligatures: normal;font-variant-caps: normal;font-weight: 400;letter-spacing: 0.544px;orphans: 2;text-align: justify;text-indent: 0px;text-transform: none;widows: 2;word-spacing: 0px;-webkit-text-stroke-width: 0px;white-space: normal;text-decoration-thickness: initial;text-decoration-style: initial;text-decoration-color: initial;background: white;line-height: 2em;">1.整体架构和规模



B 站是一个视频分享平台,拥有海量数据。大数据平台要支撑公司的众多业务,包括 AI、商业等重要应用。


大数据平台整体是一个“五层一体”+“存算分离”的架构,底层是分布式文件系统;中间有智能调度层,以及不同的计算引擎如 Spark、Flink 等,还包括各种客户端,以及实时数据流 Kafka、OLAP 引擎 ClickHouse 等,还有一些自建的工具和 CI/CD 平台。



平台任务量非常大,每天有 27 万个离线任务计算,2 万左右的 Ad-hoc 查询,7000 个左右重要的实时业务。团队的咨询量也非常大,每周有上千条咨询,每个小团队每周要处理 3 人天的咨询量,需要安排一个人专门处理业务上的咨询,回答用户关于任务失败、任务变慢等问题。


ingFang SC", system-ui, -apple-system, BlinkMacSystemFont, "Helvetica Neue", "Hiragino Sans GB", "Microsoft YaHei UI", "Microsoft YaHei", Arial, sans-serif;font-size: 17px;font-style: normal;font-variant-ligatures: normal;font-variant-caps: normal;font-weight: 400;letter-spacing: 0.544px;orphans: 2;text-align: justify;text-indent: 0px;text-transform: none;widows: 2;word-spacing: 0px;-webkit-text-stroke-width: 0px;white-space: normal;text-decoration-thickness: initial;text-decoration-style: initial;text-decoration-color: initial;background: white;line-height: 2em;">2.用户的问题


关于离线计算,用户主要有两个问题,一个是为什么任务失败,另一个是为什么任务变慢。


(1)任务为什么会失败


当然,可能还会有其它一些原因造成任务失败,比如内存相关的问题等等。


(2)任务为什么会变慢


任务失败或变慢的原因非常繁杂,需要逐一排查,耗时耗力,因此我们需要探索利用智能手段来协助解决问题。



用户的提问通常是比较工程化的,没有很多描述,往往就是一个问题+一个链接,或者比较友好一点的会再加上一个截图。






欢迎光临 链载Ai (https://www.lianzai.com/) Powered by Discuz! X3.5