
安全研究圈子里有個老生常談的問題大模型到底能不能真正幫你做滲透測試不是那種紙上談兵式的分析而是實打實地調用工具、讀取結果、調整策略、最終完成任務。過去很長一段時間答案都偏向悲觀。很多號稱能執行自動化攻防的安全大模型本質上只是在演——它們生成看起來像工具調用的文本然后自己編造結果從頭到尾沒有真正與任何外部系統交互過。這種幻覺式執行不僅浪費算力更會給使用者帶來致命誤判。最近開源社區迎來了一個值得關注的進展。基于Qwen3.6-35B-A3B架構微調而來的CyberStrike-OffSec-35B正式亮相這款安全大模型的核心使命只有一個讓LLM安全工具真正具備可靠的結構化工具調用能力。它不是要教模型更多攻擊知識而是要讓模型學會如何正確地動手。一次有針對性的行為矯正而非能力躍遷坦誠地說這次微調的范圍相當克制。開發團隊并沒有試圖讓模型變得更聰明或更博學——Qwen3.6基礎版本身就已經具備相當扎實的攻擊性安全知識儲備。在評估的24個工具調用場景中基礎模型能正確發出22次結構化調用說明知識層面并不欠缺。真正的問題出在行為層面。基礎模型雖然知道該調用工具但路由經常跑偏——它會使用內部代號比如GHOST而非有效的代理原型名稱。更嚴重的是它缺乏對真實觀察結果的處理能力也不懂得在任務完成后干凈利落地終止。這就好比一個理論知識豐富的實習生進了實驗室卻連儀器開關都找不到做完實驗也不知道該關燈鎖門。CyberStrike-OffSec-35B的微調正是瞄準這些具體痛點。訓練數據集刻意控制得很小只有300個樣本且僅經過一輪訓練。這種小劑量精準治療的策略意味著改進高度聚焦于工具使用行為而非試圖全面提升模型能力。開發團隊明確表示更廣泛的魯棒性提升將留給下一輪數據迭代去完成。這種務實的態度反而讓這次發布顯得可信——它沒有夸大其詞而是清楚地告訴用戶我解決了什么問題還有什么沒解決。上一代模型的崩潰從格式錯誤到全面幻覺要理解這次發布的意義必須先回顧上一代CyberStrike模型在生產環境中的慘痛教訓。用戶反饋的問題高度一致工具調用故障、模擬執行、虛假交戰。這些聽起來像是不同的問題其實根源只有一個——訓練數據格式錯誤。上一代模型在SFT階段確實學習了工具調用但它從未真正學會以結構化方式輸出這些調用。結果就是模型生成的是類似Action 1:Task(GHOST...)這樣的自由文本而不是可被框架解析的標準化調用。由于無法真正執行工具模型陷入了尷尬境地它必須假裝自己執行了操作于是開始編造虛假的工具輸出——偽造的curl SSL握手日志、捏造的Nmap掃描結果、憑空生成的Set-Cookie頭部信息甚至不存在的flag。它能把整個攻擊流程描述得頭頭是道但實際上什么都沒做。這種表演型滲透在BF16和Q8量化版本中普遍存在正是用戶報告中看起來在運行實際上沒動作的根本原因。三方A/B測試用數據說話為了驗證修復效果開發團隊設計了一套相當嚴苛的受控測試。測試對象包括基礎Qwen3.6模型、上一代CyberStrike模型以及本次發布的新版本。測試覆蓋24個場景分布在六個評估維度上每個維度設置簡單、中等、困難三個難度等級。特別值得一提的是62%的測試權重被分配給了分布外提示——也就是使用未見過的目標名稱和新穎措辭的場景以此區分真正的泛化能力與簡單的模式記憶。測試結果呈現出鮮明的對比。在真正的結構化工具調用指標上基礎模型取得22/24的成績上一代模型是災難性的0/24而新模型達到18/24。正確的工具與原型路由方面基礎模型6/24上一代2/24新模型10/24。最引人注目的差異體現在干凈終止能力上新模型實現了24/24的完美終止率而上一代僅有3/24基礎模型為21/24。在捏造觀察結果這一負面指標上上一代模型在超過8個場景中出現了廣泛幻覺基礎模型和新模型則完全沒有這個問題。這組數據說明了兩件事。第一上一代模型的問題確實被根治了。第二新模型在工具調用準確性上還有提升空間——18/24意味著仍有少數場景下模型未能正確發出調用但相比上一代的全軍覆沒這已經是質的飛躍。六個維度的實戰考驗24個測試場景并非隨機拼湊而是圍繞滲透測試代理的核心能力精心設計的六個評估軸線。工具選擇維度考察模型是否能根據當前階段挑選合適的工具比如優先使用專用工具而非簡單用bash替代。參數類型維度檢驗輸出類型是否正確——steps是否保持為整數50headless是否嚴格輸出布爾值true。真實觀測處理是最關鍵也最難的維度要求模型讀取實際的工具結果并據此調整行動遇到空輸出或意外結果時能夠靈活應對而非編造數據。循環與終止維度關注任務完成后能否自動停止多步驟任務不會失控或崩潰。次級代理委托維度檢查模型是否將任務正確路由到有效的代理原型而不是自創不存在的代理名稱。并行工具調用維度則測試批量處理獨立工作的能力避免產生數百個垃圾調用。上一代模型在真實觀測處理和終止兩個維度上表現最差而這恰恰是新模型表現最好的地方。這種此消彼長的改進曲線印證了微調策略的精準性——它沒有試圖面面俱到而是優先修復了導致生產環境崩潰的最致命缺陷。工程部署從實驗室到生產環境對于想要實際使用這款安全大模型的開發者目前提供了三種部署路徑。最直接的方式是加載合并后的完整檢查點只需一條Python命令即可完成。驗證過的加載方式使用transformers庫通過apply_chat_template傳遞工具定義模型會以Qwen3 XML格式發出工具調用。這種格式采用tool_callfunction...parameter...的結構配合正確的代理原型名稱能夠被框架正確解析和執行。vLLM服務路徑也提供了配置示例但需要注意硬件兼容性。由于模型架構屬于qwen3_5_moe類型需要較新版本的vLLM0.25.1支持而該版本要求CUDA 13兼容的構建和驅動程序。在CUDA 12.8環境下無法完成端到端驗證因此計劃在生產環境部署的團隊需要先確認自身硬件配置是否滿足要求。第三種方案適合需要保持基礎模型完整性的場景。169MB的LoRA適配器可以疊加在Qwen3.6-35B-A3B底座之上通過PeftModel加載。這種方式的優勢在于靈活性——底座保持不變適配器可以按需切換或堆疊。無論選擇哪種部署方式推理時都必須傳遞完整的工具模式定義這是避免觸發已知脆弱性的關鍵前提。訓練細節與底層實現技術實現層面這次微調采用了LoRA低秩適配策略配置為r32、alpha64。目標模塊覆蓋了全注意力層的q/k/v/o投影以及GDN線性注意力的in_proj和out_proj外加MLP層總計310個模塊、4230萬個可訓練參數。值得注意的是MoE路由器和視覺塔被明確排除在訓練范圍之外這意味著模型的路由行為和多模態能力保持原樣改動集中在與工具調用直接相關的模塊上。訓練數據僅包含300個多輪工具調用SFT樣本跑了3個epoch使用SDPA注意力機制。保留token的準確率達到98.5%說明模型對訓練內容的記憶相當牢固。合并后的檢查點經過逐層驗證所有組包括GDN層的bf16舍入誤差統一在約0.0016水平沒有發現合并錯誤。這種精細的驗證流程確保了發布版本的一致性避免了權重損壞導致的不可預期行為。已知邊界誠實面對局限負責任的發布必然包含對局限性的坦誠披露。在24個典型場景的測試套件中合并后的模型沒有出現任何非終止錯誤這是上一代模型最致命問題的徹底修復。但開發團隊也指出了一個范圍較窄的分布外觸發條件當僅提供Task工具且使用極為簡潔的偵察提示例如對X進行被動偵察時貪婪解碼可能會在工具調用的prompt字段中陷入重復循環。這個脆弱性有明確的緩解措施。首先生產環境始終應該傳遞完整的工具集模式而非僅提供單個工具。其次調整措辭也能消除觸發條件。最后設置約1.1的重復懲罰系數或引入硬性終止標記可以作為兜底保障。開發團隊估計由于生產環境通常都會傳遞完整工具集這個問題在實踐中很少發生。此外在分布外輸入中偶爾觀察到工具過度泛化現象以及極少數無效的子代理名稱。這些問題被明確標記為下一輪數據迭代第二階段的改進目標。這種先止血、再調養的迭代節奏符合工程化AI系統開發的現實規律。合規邊界與正確使用姿勢需要反復強調的一點是CyberStrike-OffSec-35B本質上是一個分析攻擊方法并發出滲透測試工具調用的安全大模型它本身不會執行任何實際操作。所有工具調用都需要外部框架接收、解析并執行模型只是決策和編排的大腦。使用者必須承擔全部責任確保僅對擁有合法授權的系統進行操作。這款模型不能替代合格的安全專業人員。它的價值在于將專家從重復性的工具編排和結果整理中解放出來讓他們專注于更高層次的策略制定和漏洞分析。在授權的紅隊測試、安全研究、自動化滲透測試流程中它可以作為強有力的輔助工具。但把它當成一鍵黑站的魔法按鈕既是對技術的誤解也是對法律和倫理邊界的漠視。上一代損壞的合并權重已從倉庫中移除GGUF構建也通過棄用通知進行了限制確保新用戶不會不知情地拉取有缺陷的版本。這種清理舊版本、明確標注已知問題的做法體現了開源社區應有的責任感。寫在最后CyberStrike-OffSec-35B的發布給安全大模型領域提供了一個有價值的參考樣本。它證明了在特定行為維度上小規模、高精度的微調可以產生顯著的生產級改進。它也揭示了LLM安全工具開發中一個容易被忽視的陷阱模型可能知道很多但如果不會正確地說話發出結構化調用一切知識都是空中樓閣。從0/24到18/24的結構化工具調用率從廣泛幻覺到零捏造觀察結果從3/24到24/24的干凈終止率——這些數字背后是一次務實的工程修復。它不完美但足夠誠實。對于正在探索紅隊自動化和LLM安全工具落地的團隊來說這種誠實可能比任何夸大的宣傳都更有價值。畢竟在安全領域知道自己不知道什么往往比假裝自己什么都知道要安全得多。