| 逃離數據地獄指南 | 數據破局實戰檔案 |

Excel 手動 K-Means 的無盡迴圈?看 AI 如何一鍵完成智慧病患分群

告別公式煉獄:從手動迭代到 AI 秒速收斂,精準病患分群不再是惡夢。

PRO-Cube 分析矩陣

現況剖析與統計 (Diagnostic) ‧ Level 3 (進階整合應用)

Healthcare

商業危機與痛點

螢幕上的藍光映照在 Dave 疲憊的臉上,時鐘無情地指向午夜兩點。Mark 的指令像詛咒一樣在耳邊迴盪:「明天早上九點,我要看到一個全新的、基於數據驅動的病患分群模型,用來決定下個季度的資源投放策略。」這不僅僅是一份報告,這是攸關數百萬預算的戰略基石。

Dave 的 Excel 活像一個搖搖欲墜的巴別塔。數百個儲存格裡塞滿了由 SQRTSUMXMY2 構成的歐幾里得距離公式,每一個公式都像一條脆弱的絲線,將五十位病患的數據點與三個假設的群體中心連結起來。他剛剛完成了第七次手動迭代,小心翼翼地用 AVERAGEIFS 重新計算出新的群體中心,然後屏住呼吸,將結果「選擇性貼上為值」,以斬斷那該死的循環參考。然而,群組的成員分配幾乎沒有變化,模型收斂的速度慢如冰河。他知道,只要一個複製貼上失誤,整個結構就會瞬間崩塌。

更糟的是,Mélanie 明天將會親自審核他的方法論。她會像鷹眼一樣,質問每一個手動步驟的合理性與可重複性。在這座由無數公式堆砌的迷宮裡,Dave 感覺自己不是在分析數據,而是在向上帝祈禱,祈禱這脆弱的平衡能撐到日出。

傳統的 Excel 分群是一場意志力的消耗戰。你被困在一個由 SQRTSUMXMY2AVERAGEIFS 函數編織的脆弱蛛網中。每一次手動計算距離、重新分配群組、再更新群體中心的過程,都像是在走鋼索。為了打破循環參考,你被迫反覆進行「複製、選擇性貼上為值」這個最原始的操作。這不僅僅是效率低下,更是一種精神折磨,每一步都充滿了讓整個模型毀於一旦的風險,將寶貴的分析時間浪費在無盡的機械式勞動上。

現在要處理的資料如下:

Patient_ID,Age,Gender,Blood_Type,Systolic_BP,Diastolic_BP,Has_Diabetes,Treatment_Plan
PID-1001,45,Male,O+,125,82,False,Lifestyle Change
PID-1002,68,Female,A-,155,95,True,Insulin Therapy
PID-1003,29,Male,B+,118,78,False,Routine Checkup
PID-1004,52,Female,AB+,142,91,False,Medication-A
PID-1005,71,Male,O-,160,100,True,Medication-B
PID-1006,34,Female,A+,122,80,False,Routine Checkup
PID-1007,48,Male,B-,135,88,True,Dietary Control
PID-1008,59,Female,O+,148,94,True,Medication-A
PID-1009,25,Male,A-,115,75,False,Routine Checkup
PID-1010,63,Female,AB-,151,96,False,Lifestyle Change

..... (共計 50 筆資料,請下載完整檔案進行實戰)

實戰演練素材

下載此範例資料,直接拖曳至 Gemini 進行對話演練。

下載 CSV 檔

[P]rompt 神級咒語

請將剛下載的 CSV 拖曳放入 Gemini 視窗,並貼上以下咒語:

你是一位頂尖的資料科學家,專精於使用 K-Means 演算法進行客戶分群。 我的目標是對這份病患資料進行分群,以找出具有相似特徵的群體,從而實現更精準的醫療資源分配。請使用 K-Means 演算法完成以下任務: – 請分析我提供的 CSV 資料,並特別針對以下「數值型」欄位進行分群:`Age`, `Systolic_BP`, `Diastolic_BP`。 – 請將病患分為 3 個群體 (k=3)。 – 對於每個群體,請分析並總結其主要特徵(例如:高齡高血壓群、年輕健康群等),並為每個群體取一個有意義的標籤名稱。 最終,請以一個新的欄位「Cluster」,標示每位病患(Patient_ID)被分配到的群組標籤名稱。 請直接處理並回傳包含「Patient_ID」與「Cluster」這兩個欄位的 CSV 格式結果。

[P]rove 稽核驗證點

  • K-Means 的核心是『距離』。AI 處理的是純粹的數學運算,它在多維空間中計算每個點到群體中心的『歐幾里得距離』。這解釋了為什麼我們只選擇數值型欄位 (`Age`, `Systolic_BP`, `Diastolic_BP`) 進行分析,因為非數值欄位如 `Gender` 或 `Blood_Type` 無法直接參與距離計算。
  • 傳統 Excel 的痛點在於『迭代收斂』。你手動執行的複製貼上,是為了打破公式的循環參考,模擬演算法一次又一次的重心更新。AI 在後台以毫秒級的速度完成了這個你耗費數小時的過程,直到每個群體的成員不再變動,即達成『收斂』狀態。
  • AI 回傳的群組標籤(例如:高齡高血壓群)並非演算法的直接輸出,而是基於最終群體成員的數據分佈(例如該群體平均年齡最高)所做的『詮釋』。這層語意分析,是大型語言模型在純粹的數學分群之上,提供給你的額外價值。

職場防雷提示:

範例資料中故意埋放了空值與格式錯誤,請務必驗證 AI 產出的結果是否正確避開了這些坑!

[P]rocess 執行步驟

  1. 選取並複製上方提供的 Pro CUBE Prompt。
  2. 打開您慣用的 AI 工具(例如 Google Gemini 或 ChatGPT),將 Prompt 貼入對話框中。
  3. 將您的完整病患資料(包含標題列)從 Excel 中複製,並直接貼在 Prompt 的下方,然後發送。
  4. AI 將回傳 CSV 格式的結果。請將其複製並貼到新的 Excel 工作表中,即可完成病患與其所屬分群的對應表。

你的價值,不在於重複計算,而在於洞察詮釋。

那場與 SUMXMY2AVERAGEIFS 的深夜搏鬥,不是你能力的缺陷,而是工具的極限。你試圖用螺絲起子去鑿牆,那份挫折感源於此。AI 不是來取代你的分析大腦,而是來拆除那面牆,將你從重複計算的牢籠中解放出來。現在,你的寶貴精力可以從繁瑣的『如何分群』,轉移到更具價值的『為何如此分群』。去解讀群體背後的故事,去制定真正影響策略的洞察。讓機器去執行指令,讓你去洞見未來。這,才是你真正的力量所在。

Author’s Note & Inspiration:

The core analytical framework of this case is inspired by Mastering Excel through Projects by Hong Zhou (Chapter 8: K-Means Clustering and Interactive Calculation). This article serves as both a tribute to the original concepts and a modern challenge to push those boundaries further using AI-driven automation.

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *