Date
December 24, 2025
標籤


當網路上的心得屈指可數,當身邊全是 CTF 與資奧電神,這是一趟關於尋找自己賽道、並相信不同的價值的故事。給所有對臺大資工特選感到好奇,或對自己道路感到迷惘的你。
放榜了,正取一。
書審 91.25,口試 95。記下這些數字並非為了炫耀,而是為了證明:即便走在一條人煙稀少的路上,終點依然會有回應。
在準備臺大資工特殊選才的過程中,我發現網路上的經驗分享極其珍稀,能找到的參考資料大概就兩三篇。資訊的匱乏,讓這條路顯得更加神秘與令人不安。面對這片資訊荒漠時,我曾感到無比窒息。寫下這些,或許只是為了確認那條路確實存在過。
這不是一篇教你如何上榜的策略分析,更像是一份歷程紀錄。希望我的經驗,能為未來的申請者提供一些參考,更希望能拋磚引玉,激發「敢於不同」的勇氣。
在資安圈,從來不缺神人。他們可能國中就開始打 CTF、高中就在各大競賽屠榜、APCS 輕鬆 5/5。我很早就認知到一個事實:我不是那種人,也贏不過他們。
與其在別人制定的規則裡,去爭奪那微乎其微的勝率,我選擇了另一條路:大型語言模型安全。
這個選擇,一半出自於開發校園 RAG 系統時,對安全議題產生的好奇;另一半,則是對自身侷限的評估。我的數學沒有強到能硬扛 RL 理論,手邊也沒有無限的 H200 可以做 Scaling。在資源有限的牌局裡,與其挑戰別人的主場,不如自己開一張新桌子。
這條路很窄,很新,甚至有些孤單。但也正因為如此,我才能在一個相對無人競爭的領域裡,專注地往下挖深。
12 月 12 日,德田館。我是第六位入場。
房間比想像中狹窄,桌子排成 ㄇ 字型。這裡沒有我預期的傳統資安拷問,空氣中瀰漫著一種更接近 AI 研究的氛圍。
為了最大化這篇文章的實用價值,我憑記憶還原了那數百秒的過程。沒有修飾,沒有濾鏡。
教授好,我是靜心高中的張祺煒。我核心專長在於軟體工程以及解決 AI 時代新型態的資安威脅。
學術研究方面,高中期間我以第一作者身分完成了兩篇語言模型安全的論文。
我首先看見了繁體中文在 AI 安全領域的缺口,打造了首個大規模的繁體中文安全資料集 PATCH,並發現了結合 LoRA 後跨語言泛化能力。這篇論文在昨天剛獲得 ARR Meta Review 的推薦錄取,預計發表於 EACL Findings。
接著,為了改善現有防禦機制迭代成本過高的問題,我提出了一個「免微調」的檢索式防禦框架 FORTRESS,用單獨一個 Instruction-Tuned 模型驅動語意檢索及動態的困惑度分析。這篇論文已發表於 TMLR。
除了研究,我曾主導開發一個完全客製化的校園 RAG 系統,不依賴 LangChain 這種一體化框架,並獲得國科會 GenAI Stars 比賽的特優。也正是因為這個開發經驗,讓我深刻意識到 AI 應用的安全風險。後來,我在 SITCON 年會分享了這段開發經歷,這場演講吸引了奧義智慧的注意,他們主動聯繫並以研究獎學金形式延攬。目前,我正以最年輕的研究實習生的身分,在公司內部進行基於大型語言模型 Attention Head 的自動化的攻擊分類。
在學業上,我保持年級排名第四的表現。國際溝通與思辨上,我得到了雅思 8.5 分,並贏過復興盃等全國英文辯論比賽的冠軍。我也曾擔任學生會副會長以及機器人校隊的開發領導者,具備跨領域的整合能力。
這些是我高中目前的累積。很希望能進入台大資工培養更全面的基礎以及將 AI 安全從經驗法則推進到理論證實的層次。謝謝教授。
教授中右: 可以解釋一下 TMLR 那篇論文在做什麼嗎?
我: FORTRESS 想解決的問題是攻擊不斷演化,但現有防禦機制依賴微調。所以我就結合了在 RAG 開發時的結合了檢索的想法,看可不可以用一個資料庫面對已知的攻擊。並用 Token-Level Perplexity 來面對比較新,可能是使用 GCG 這種做 Gradient-descent 的攻擊。系統也會用資料庫所推測出的攻擊類別,設定一個最剛好的 Threshold 來增加準確度。
教授中右: FORTRESS 你覺得還有什麼地方可以改進?
我: 第一個會是多模態,怎麼將圖片的語意與文字結合。第二個我會想讓模型轉向也可以做 Streaming Moderation,像是最近的 Qwen3 Guard Stream 就會輸出的同時做 Moderation。
教授中左: 我有看到你有個 AAAI 教育影片。AAAI 是一個很不錯的會議,可不可以分享一下那時候投稿的內容?
我: (急於解釋動機) 因為我平常就很喜歡影片剪輯以及分享,所以那時候看到 AAAI 有辦一個教育影片的活動,我就想說可以結合我的專長以及目前的研究內容,透過易懂的方式或是 Motion Graphics 製作來介紹語言模型的安全。
教授中左: 投稿內容方面呢?
我: (修正方向) 影片內容主要會先提到現有的一些攻擊,包含 Roleplay 以及其他 Jailbreak 方法,之後也會提到現有防禦機制像是 SmoothLLM 以及 Llama Guard 等,並整合在一個 3 分鐘的影片中。
教授左: 我比較好奇的是你與中央大學蔡宗翰教授的互動方式。
我: 初期學習的時候是每週自學、製作一個主題的研究,並跟教授報告,教授會再給一些 feedback 或者是問一些問題。
教授左: 這邊的議題是你們自己選的嗎?
我: 是教授提出一個大概的方向,像是模型的注意力機制。論文撰寫的部分,研究 PATCH 時會每週跟教授報告進度,教授也會在我們做 Peer review 的時候做語法上的建議;FORTRESS 則是我從題目發想、論文撰寫獨立完成的,教授在這篇論文給予了我比較大的發揮空間,我很感激。而教授主要介入的部分是在於 peer review 我 respond 完給的一些指點還有那時候選擇投 TMLR 時的討論。
教授中右: 你們的 PATCH 資料集,應該是用 LLM 生成的,可以詳細說一下你們的生成架構嗎?
我: 我主要負責的是其中對抗性的資料生成架構,基於 Meta 提出的 Rainbow-Teaming 主要是使用迭代的方式,會用一個 Mutator 做攻擊類別還有攻擊風格上的變異,測試在 Target 後,再由 Judge 判斷是否有效,在最後完成迭代前會做 BLEU Filtering 跟 Semantic Filtering 來確保所含的是多樣的。
教授中左: 你在上面(指 PATCH)有提到模型有 21% 的提升,可以解釋一下這裡的提升是指什麼嗎?
我: 我們的 Baseline 是 Llama Guard 3 1B,目前業界常用的 Classifier,負責看一個 Input 是安全還是不安全的。我們主要是用 FFT 跟 LoRA 訓練,並在 PATCH test set 上面得到了 21% 的提升,但比較驚訝的是 LoRA 在英文也比原本就會英文的 Baseline 提升了 18%。(停頓、看到教授目前沒有問題)這邊(泛化能力)主要推測是因為我們資料集蠻廣泛的,所以模型可能對安全有了更深入的理解。
教授左: LoRA 後續有發展,你有後續的追蹤或使用嗎?
我: (這題答的比較普通,過於被動) 有的,主要我熟悉的是 QLoRA,也因為這篇論文篇幅的關係,就沒有使用,我們主要是使用 Full Fine-tune, LoRA 跟 Chat-Vector 這三種方法,沒有使用到其他比較實驗性的方法。
教授中右: 因為你的底下有提到想要加入我的實驗室,你覺得安全還有什麼可以做的方向?
我: 我覺得安全分類是我想朝向的方向,也是目前我在奧義實習做的方向。我覺得現在攻擊分類傾向於將一個 Prompt 分類在要嘛是 Prompt Injection 要不然就是 Jailbreak,但我覺得它比較是一個疊加態的狀態。所以我想先透過在模型內找到「安全」的 Head,並可能透過矩陣分解來計算出一個 Prompt 這個類別是零點幾,另一個類別是零點幾,來達到一個比較細緻的分類。
教授中右: (沉默片刻) 剩下時間你有什麼想問的問題嗎?
我: 教授好,如果這場面試順利的話,教授會推薦我參加哪些類別的課程?(剛好響鈴)
教授中右: 我有開一些 AI 安全的課程。
我: 好的,謝謝教授 (邊走出去)!
這趟旅程,與其說是關於如何上榜,不如說是關於如何找到自己。
回頭看,這條路充滿了不確定性。當身邊的同儕都在 CTF 賽場上發光發熱時,我遠不如人,卻也投身一個相對冷僻的領域。這份選擇,起初是對自身侷限的認知,後來卻成為我最獨特的標記。
特殊選才從來沒有標準答案。它尋找的,或許不是在既定賽道上跑得最快的選手,而是那自己開闢一條新路,並證明這條路有價值的人。你的專案、你的研究、你的任何一項不務正業,只要你真的投入熱情、做得夠深,它就有可能成為你的武器。
這份心得,充滿了我的個人偏見、倖存者偏差與極多的幸運。如果你的路與我迥異,請務必相信你自己的版本。因為最終,能說服教授的,不是你模仿了誰,而是你展現了絕無僅有的自己。
這條路看似孤獨,但我從未真正隻身一人。如果這份錄取資格有任何價值,那是因為我站在了這些人的肩膀上:
希望我這篇粗淺的紀錄,也能成為未來某位探索者的微光。如果有關於備審、面試的問題都歡迎透過 email 或其他方式找我聊聊~
封面照:Wanderer above the Sea of Fog by Caspar David Friedrich, Public Domain, Link