
導讀茶理宜世 CHARLIES TEA 創立于 2015 年是新式江南鮮茶品牌將傳統茶文化與現代潮流相結合。作為國內領先的生活服務茶飲品牌茶理宜世在多業務協同與實時洞察場景下對數據分析性能和系統穩定性提出了更高要求。通過引入云器Lakehouse構建一站式大數據平臺茶理宜世成功實現了維護成本降低 60%一鍵式部署和運維不再需要單獨維護多個組件性能提升單引擎覆蓋多種業務場景離線 ETL 性能提升 2 倍BI 查詢性能平均提升 20%-30%開發效率提升一站式平臺完成數據分析和報表開發彈性擴展按需彈性擴縮容支撐業務快速增長客戶證言云器 Lakehouse 幫助我們在盡量控制遷移風險和成本的前提下完成了數據平臺的整體升級與架構優化。平臺在穩定性和性能層面均有明顯提升運維成本下降約 60%同時也顯著降低了日常運維和故障處理的復雜度。更重要的是數據團隊得以從大量基礎設施維護和性能調優工作中解放出來將更多精力投入到業務數據建模、分析能力建設以及對經營決策的支持上。隨著查詢性能的持續提升BI 報表的響應速度和交互體驗得到明顯改善數據分析逐步從可用走向好用。—— 茶理宜世 大數據負責人現狀與痛點1.1 架構背景隨著門店數量持續增長數據規模同步擴大。為了分析用戶行為、優化運營策略、提升服務質量茶理宜世早期自建了一套大數據平臺。原有架構數據源MySQL 生產數據庫數據同步源庫小時級同步到茶理宜世自建 MySQL數據處理層DataX 天級同步至 StarRocks 集群數據加工StarRocks 中按 ODS→DWD→ADS 分層加工天級離線數據消費帆軟 BI 通過 JDBC 連接讀取數據生成可視化報表1.2 核心問題業務規模擴大后數據平臺暴露出以下核心痛點問題一自建運維負擔重MySQL、DataX、StarRocks 等組件需要專人維護缺乏自動化運維能力人力占用大StarRocks 集群資源固定高峰期性能不足、低谷期資源閑置數據同步和任務調度開發成本高問題二數據源分散缺乏統一集成方案和數倉模型數據源散落在不同系統缺乏統一的企業級數據倉庫模型鏈路復雜導致數據模型管理困難影響決策準確性升級選型為什么選云器Lakehouse2.1 關鍵選型因素經過內部評估茶理宜世明確了以下核心訴求關鍵能力分類NO.關鍵項說明已有能力保持及優化1多數據源接入能力需要支持MySQL、Kafka、Oracle、API 等多種數據源的接入方式并將各服務統一的數據進行實時或批量攝入Lakehouse中2高效的數據存儲與計算需要對大量數據進行高效存儲和管理、計算等操作3統一的企業級數據倉庫模型使用Lakehouse建立統一的企業級數據倉庫模型4BI報表開發工具集成集成BI工具快速搭建各類數據分析報告和儀表板為決策提供有力支持新一代湖倉平臺能力建設5Serverless彈性能力業務波動大需要資源能夠靈活彈縮按需計費6兼容Spark/Mysql SQL現有 大部分數據開發基于Starrocks SQL新引擎需要兼容主流SQL方言7存算分離架構降低存儲成本計算資源可獨立擴展運維負擔8全托管、零運維將工程師從集群管理、參數調優等事務中解放出來專注于業務價值創造9高可用保障平臺需要具備自動故障轉移、數據備份等高可用能力2.2 方案選擇在評估繼續使用自建 StarRocks、遷移到其他開源方案等選項后團隊最終選擇引入云器 Lakehouse作為新一代一體化湖倉平臺的核心。云器 Lakehouse 方案的核心優勢需求維度云器Lakehouse解決方案數據接入1. 通過云器提供的多種數據源連接方式如Kafka、MySQL、Oracle等將各服務統一的數據進行實時或批量攝入Lakehouse中2. 支持多表實時、多表合并分庫分表合并的場景、整庫離線等多種同步方式3. 可視化點點點快速配置完成開發數據存儲與計算1. 統一流批交互真Kappa架構以增量計算新模式支持的Single Engine高效開發完整SQL語法/UDF支持與離線SQL開發基本一致大規模低成本湖倉存儲狀態支持大規模擴展自動增量優化顯著降低資源成本。靈活申明式開發范式一次開發、流批可調2. 原生存算分離架構統一數倉模型1. 使用Lakehouse建立統一的企業級數據倉庫模型2.1N 引擎消除冗余計算減少數據口徑誤差BI集成1. 提供Python SDK/JDBC集成簡單1個人一周內就可以完成2. 兼容多種BI工具帆軟、Tableau、觀遠 BI等彈性能力1. 純Serverless按需彈性而且實現秒級彈縮彈性性能更極致收費可以精確到1分鐘2. 用資源才收費不用不收費成本大幅降低SQL兼容性1. 兼容Spark SQL2. 兼容Presto 、Mysql、PostgreSQL等 sql 方言湖倉能力1. 天然湖倉一體架構一個引擎同時支持離線加工、基于增量計算的實時加工、實時分析等多場景2. 有很好的開放性兼容Iceberg、Parquet、HMS等可被外部引擎消費運維負擔全托管零運維無需關心底層基礎設施云器 Lakehouse 方案介紹3.1 新架構設計基于云器 Lakehouse茶理宜世重構了數據平臺架構。第一階段架構快速遷移簡化運維與原架構對比簡化運維原來的 MySQL 同步 → DataX → StarRocks 三段全部需要自運維現簡化為只運維數據接入端的自建 MySQL其余交給免運維的云器 Lakehouse統一平臺、多源集成靈活接入MySQL、Oracle、API 等數據源均通過 Studio 數據集成統一接入。接入、推送、存儲、計算、建模全部在一個平臺完成工具鏈完善涵蓋數據集成、開發、運維、調度、監控、質量、權限、數據資產、AI、DataGPT 等全套工具鏈彈性資源從固定資源3 臺 16 core / 128 G改為按需彈性的 Serverless 模式數據質量與治理增強全鏈路監控Studio 提供完整的數據監控和質量管理及時發現異常權限管控細粒度權限管理保障數據安全合規資產化管理數據資產管理讓數據價值可視化、可衡量統一查詢引擎Single Engine單引擎統一處理 OLTP 和 OLAP 查詢標準 SQL完全兼容 Spark SQL 及 Presto、Hive、MySQL 等方言支持 BI 工具 JDBC 連接應用遷移零改造智能優化自動索引、智能緩存等優化縮短復雜查詢響應時間同時新增AI 能力降低數據分析門檻DataGPT / Copilot業務人員用自然語言提問即可獲取數據洞察無需編寫復雜 SQL智能 SQL 生成DataGPT 自動把業務問題翻譯為優化后的 SQL分析效率提升 5 倍以上自動化洞察AI 自動識別數據趨勢、異常和關聯模式為運營決策提供建議降低門檻非技術人員也能快速完成數據查詢和分析第二階段架構基于 Lakehouse 的業務架構演進架構升級對比從分散到統一原架構痛點數據孤島、處理滯后。外部數據源經 API 批量寫入 MySQL再小時級同步到自建 MySQL最后同步到云器 Lakehouse。鏈路過長導致時效性差無法支撐實時業務決策。新架構價值實時性大幅提升業務決策更及時對比原架構小時級同步 → 實時同步。API、Oracle 等多源數據通過 Studio 數據集成直接接入消除中間環節數據延遲從小時級降到秒級 / 分鐘級增量計算升級原離線天級批處理改造為實時集成 增量計算報表更新從 T1 提升到準實時3.2 關鍵能力實現3.2.1 數據接入兩種方式靈活選擇云器 Lakehouse 提供兩種數據接入方式方式一SQL 方式以對象存儲為例--創建volume, 用于映射對象存儲目錄 CREATE EXTERNAL VOLUME pipe_volume location oss://ossmy/autoloader/pipe/ using connection my_connection_exnet directory ( enabletrue, auto_refreshtrue ) recursivetrue; -- 創建實時同步任務 create pipe volume_pipe_list_purge VIRTUAL_CLUSTER default --執行獲取最新文件使用掃描文件模式 INGEST_MODE LIST_PURGE as copy into pipe_purge_mode from volume pipe_volume(id int,col string) using csv OPTIONS( headerfalse ) --必須添加purge參數導入成功后刪除數據 purgetrue ;方式二界面化配置在云器 Studio 可視化界面即可配置實時同步對象存儲、Kafka 等和 30 數據源的批量導入導出支持全量 增量同步自動化字段映射無需手動維護類似 DataX 的配置3.2.2 BI集成支持多種連接方式無縫對接BI3.3 遷移實施遷移策略平滑過渡零業務中斷1. 第一階段驗證測試2 周在云器 Lakehouse 構建測試任務同步部分歷史數據做功能驗證BI 報表對比測試2. 第二階段并行運行1 周新老系統并行、雙寫數據逐步將 BI 報表切換到新平臺監控性能和穩定性3. 第三階段全量切換1 周完成所有業務遷移下線舊 StarRocks 集群釋放運維資源總遷移周期4 周實際收益基于生產環境數據云器 Lakehouse 為茶理宜世帶來了以下業務價值4.1 維護成本降低 60%成本對比成本項遷移前自建StarRocks遷移后云器Lakehouse節省基礎設施成本3臺服務器16core 128GServerless按需計費60%運維人力成本1名專職DBA 50%工作量零運維偶爾配置調整80%DataX、Starrocks維護成本腳本、組件維護無需維護100%綜合成本降低 60% 以上4.2 性能提升查詢響應提速 3-5 倍ETL 任務對比測試測試背景業務場景門店經營分析看板的核心查詢按門店、商品品類、時段、營銷活動等維度復盤銷售與會員消費數據SQL 結構訂單事實表 JOIN 門店、商品、會員、營銷活動等多張維度表商品名使用 LIKE 模糊匹配門店 ID 使用大 IN 列表過濾輸出 15 業務維度聚合數據規模億級訂單明細對照口徑任務一、任務二為同一 SQL僅時間范圍篩選不同1 年 vs 半年時間范圍srlakehouse提升點規格16c/128G * 3 48C /384G32C/128G使用更少的資源(減少33%)實現更好的性能任務一1 年2min 左右1min 左右2 倍性能提升任務二半年1min 10s 左右35s 左右2 倍性能提升4.3 開發效率提升一個平臺完成數據接入、存儲、建模、計算、推送全流程任務鏈開發復雜度顯著下降可視化數據接入和運維降低了開發難度縮短了接入時間4.4 彈性支撐業務發展高峰期自動擴容促銷活動期間查詢并發從 50 QPS 升至 200 QPS系統自動擴容業務穩定低谷期成本優化閑時自動縮容節省成本快速響應需求可視化操作縮短新增數據源接入時間總結與展望5.1 項目總結茶理宜世通過引入云器 Lakehouse完成了從自建 StarRocks 到云原生湖倉的升級? 一站式平臺數據接入、存儲、計算、BI 一體化告別多組件維護? 顯著降本基礎設施成本降低 60%運維人力成本降低 80%? 性能提升BI 查詢響應提升 20%-30%用戶體驗明顯改善? 彈性伸縮Serverless 架構按需計費靈活應對業務波動? 開發提效一站式開發環境效率顯著提升5.2 未來展望基于云器 Lakehouse茶理宜世計劃進一步拓展數據平臺的應用場景實時數據分析引入流式計算實現秒級數據洞察數據科學平臺構建機器學習平臺落地用戶畫像、銷量預測等 AI 場景數據治理體系完善數據質量、血緣、安全管理體系多云部署基于云器 Lakehouse 多云能力實現跨云數據協同云器科技官網 - 改變數據的使用方式更多內容歡迎關注「云器科技」官網云器科技-多云及一體化數據平臺提供