2024 AIS3|研究專題
聚類分析技術-惡意軟體變體辨識方法研究
結合 CAPA、Jaccard、K-means 與 SentenceTransformer,自動比較未知樣本與惡意軟體家族的相似度。
- Year
- 2024
- Role
- 惡意軟體分析/分析腳本
- Team
- 4 人團隊
- Share
- 25%
專案總覽
專題目標是自動解析未知惡意軟體與已知家族間的相似度,協助逆向分析人員更有效率地識別、比較與分類變體。
不只回答樣本是否惡意,也嘗試回答它和哪些家族、能力或二進位特徵更接近。
問題與動機
惡意軟體變體會改變檔案內容、字串與包裝方式;單一雜湊難以反映行為相似度,而人工逆向大量樣本又十分耗時。
變體規避
內容稍微變動就會造成傳統雜湊完全不同。
特徵尺度不同
能力描述、文本與二進位格式需要不同的相似度方法。
方法與核心內容
系統透過 CAPA 擷取靜態能力特徵,再使用 Jaccard、K-means、SentenceTransformer 與二進位格式比較,形成多視角的相似度結果。
能力層特徵
利用 CAPA 規則將樣本行為轉換為可比較的能力集合。
多算法比較
以集合、向量與聚類方法交叉觀察樣本間的接近程度。
技術脈絡
流程從樣本靜態解析開始,分別產生能力、文本與二進位特徵,再彙整為相似度視圖。
SAMPLE惡意軟體樣本
EXTRACTCAPA/格式特徵
COMPAREJaccard/向量
VIEW聚類與相似度
執行流程
以已知家族作為參考,觀察未知樣本在不同特徵空間中的鄰近關係。
01 — 建立樣本資料
整理來源、家族標籤與可安全分析的惡意程式樣本。
02 — 擷取靜態特徵
執行 CAPA 與格式解析腳本,將結果轉為可比較資料。
03 — 計算與視覺化
比較多種算法結果,呈現家族與變體間的關係。
我的貢獻
貢獻比例 25%,主要負責惡意軟體分析、資料處理與分析腳本撰寫。
- 01樣本分析檢視樣本特性並整理可供比較的分析結果。
- 02資料處理清理 CAPA 與其他靜態分析輸出。
- 03分析腳本撰寫自動化解析與格式轉換程式。
- 04結果驗證協助比較算法結果與已知家族標籤。
成果與反思
專題完成多種特徵與算法的相似度比較流程,能以整體視圖協助觀察未知樣本和既有惡意軟體家族的關係。
惡意軟體相似度沒有單一答案;能力、語意與二進位結構各自揭露不同層次,真正有用的是能回到分析工作流程的組合。
08 / Presentation