天權6號功耗曲線優化攻關啟動會定在早上八點,但張京京七點不到就已經坐在中央研究院四號會議室的角落裡,面前攤著三份厚度不一的仿真報告。她的多時鐘域方案在RTL凍結前通過了全部時序收斂簽核,影子寄存器組異步交換路徑在最差工藝角下的延遲壓縮到了0.08納秒,比設計預期還優了0.02納秒。但功耗閉環驗證中暴露的第三個泄漏源——異構互聯總線瞬時電流尖峰被仿真平滑——並沒有隨著RTL凍結而自動消失。它只是被小芯AI預調度模型暫時壓住了,壓住不等於根治。
趙靜推門進來時手裡端著一杯沒加糖的黑咖啡,眼下的青灰色比天權6號樣片評審時又深了一層。她昨晚跑完了預調度模型在追光四期極限溫度數據上的第一輪遷移校準,結果不太好看。
「125度環境溫度下,天權4號的總線電流尖峰波形和105度下的波形在峰值區域有非線性的偏移。」趙靜把筆記本電腦接上會議室的投屏,調出兩組波形的對比圖。藍色曲線是105度下的總線電流波形,紅色曲線是125度下的波形,兩條曲線在低負載區幾乎重合,但在負載從空載跳變到滿載的那一瞬間,紅色曲線的峰值比藍色曲線高出了整整12%。「預調度模型的訓練數據全部來自天權4號在105度以下的量產測試數據,模型在125度下的預測準確率從91.5%掉到了83.7%。」
張京京盯著那兩條曲線之間拉開的喇叭口,心裡默默折算了一組數字。預調度模型的削峰邏輯是在總線事務發起前3.2納秒預測電流尖峰概率,預測值超過閾值就插入一個等待周期。如果預測準確率在125度下掉到83.7%,意味著每六次高峰值預測中就有一次漏報。漏報一次,瞬時電流尖峰就會從削峰後的43瓦跳回未削峰前的58瓦——那1.3瓦的差額是依靠先進封裝散熱方案覆蓋的,但58瓦的尖峰已經遠超封裝熱阻的承受上限。
章宸在八點整準時推門進來,身後跟著林薇和梁志遠。梁志遠手裡拿著一個金屬材質的存儲硬碟,裡面裝著追光四期首批國產化試產晶圓的全部工藝數據,以及一套剛從天權4號量產批次中抽取的極限溫度測試記錄。這套記錄是張京京在樣片評審時要求的「補課」內容——天權4號原本的規格上限是105度,但為了給天權6號預調度模型提供125度下的真實總線電流數據,追光四期測試團隊在過去一周里對二十顆天權4號晶片做了從負40度到125度的全溫度梯度掃描。
「二十顆晶片的實測數據全部在這裡。」梁志遠把硬碟接上會議室的終端,屏幕上跳出一張三維散點圖。X軸是溫度,從負40度到125度;Y軸是負載檔位,從空載到滿載八個檔;Z軸是總線電流峰值。散點圖的顏色從低溫區的深藍漸變到高溫區的深紅,在125度滿載那個角上,散點密集地聚成一個偏離整體趨勢的小簇。「這個簇就是非線性區。105度以下,電流峰值和溫度的關係基本是線性的,預調度模型用線性外推就能大致覆蓋。但從115度往上,峰值和溫度的關係開始出現明顯的非線性偏離。到了125度,偏差量已經大到不能忽略。」
林薇從梁志遠手裡接過雷射筆,在散點圖的非線性區畫了一個圈。「這不是天權4號的個例,也不是羲和架構的特有問題。根本原因在電晶體的閾值電壓溫度係數上——溫度每升高十度,閾值電壓下降大約二十毫伏,高溫下電晶體更容易導通,關斷時的漏電流呈指數級上升。我們在功耗仿真時用的是代工廠標準工藝設計套件里的溫度係數模型,那個模型的適用範圍標註到了125度,但實際精度在115度以上就已經開始發散。」
「仿真方法論的問題。」張京京說。這句話她在天權6號熱功耗攻堅時就說過一次,當時是針對林薇揭示的「用平均功耗代替峰值功耗」的缺陷。現在同樣的問題出現在了溫度維度上——仿真模型把溫度對功耗的影響簡化成了一個線性係數,但實際的物理過程在極端溫度下是高度非線性的。
趙靜把預調度模型的架構圖投到屏幕上,開始拆解問題的技術根因。小芯AI預調度模型的本質是一個輕量級神經網絡,輸入是總線事務隊列的長度、類型、發起頻率和當前溫度四個特徵,輸出是一個二分類預測——接下來3.2納秒內是否會出現超過閾值的電流尖峰。模型在天權4號105度以下的數據上訓練後,預測準確率達到94%,遷移到天權6號仿真環境後準確率降到91.5%。現在加上125度下的實測數據,準確率進一步降到83.7%。
「下降的原因分兩層。」趙靜用雷射筆點著模型的特徵重要性排序圖,「第一層是溫度特徵在高溫區的非線性變化,模型在訓練時沒有見過這種分布,所以預測失准。第二層更麻煩——總線電流尖峰的物理機制在高溫下發生了變化。105度以下,尖峰的主要來源是總線事務並發導致的瞬時開關電流疊加。但125度下,電晶體關斷漏電本身就成了一個不可忽略的電流分量,這個分量和開關電流疊加之後,峰值超出了模型的預測範圍。」
「所以預調度模型需要的不是修修補補的參數校準,而是一次重新訓練。」章宸把問題概括成一句話,然後看向趙靜。
「是重新訓練,但不只是重新訓練。」趙靜翻到下一頁,「重新訓練需要125度下的全工況總線電流數據,天權4號的二十顆晶片提供了初步數據,但樣本量遠遠不夠。預調度模型需要在至少五百顆晶片、覆蓋全部工藝角的125度實測數據上重新訓練,才能把準確率拉回到90%以上。五百顆晶片的極限溫度測試,按追光四期目前的測試產能,至少需要六周。」
「六周太長了。」林薇搖頭。天權6號的流片倒計時已經進入第八個月,物理設計正在緊鑼密鼓地推進,樣片回片前的全部軟體開發工作——包括預調度模型的最終版本——必須在流片後四個月內完成。六周的測試等待加上四周的模型訓練和驗證,留給其他環節的時間會被壓縮到危險的程度。
梁志遠在終端上調出追光四期測試車間的排期表。測試車間的極限溫度測試設備一共有四台,當前排期已經排到了三周以後,其中兩台在跑天權4號量產批次的例行老化測試,一台在跑印巴裝配廠新產線的首批晶片驗證,剩下一台在跑合城二期設備調試中提到的天權5車規版的實車路測晶片篩選。「如果要把五百顆天權4號晶片的極限溫度測試壓縮到三周內完成,需要至少三台設備並行,每台跑一百七十顆。但我們現在只能騰出一台。」
「從合城二期的設備調試預算里租一套外部的極限溫度測試設備。」蘇黛的聲音從會議室門口傳來。她本來不參加技術攻關會,但梁志遠在會前把測試資源瓶頸的消息發給了她,她直接帶著預算方案來了。「我查過,合城本地有一家第三方檢測實驗室,有兩台同型號的極限溫度測試設備,按天租用。租三周的費用大概在一百二十萬左右,可以從產業鏈彈性預算的測試驗證專項里列支。」
陳醒在整個討論過程中一直坐在會議桌靠窗的位置,面前攤著天權6號功耗閉環驗證的原始報告和張京京標註的三個泄漏源的功耗分解數據。他在蘇黛提出租賃方案後抬起頭,沒有直接批預算,而是問了一個讓所有人都停下討論的問題。
「預調度模型重新訓練需要六周,我們想辦法壓縮到三周。但如果實體清單在這三周內落地,代工通道被切斷,天權6號的流片窗口還能不能保得住?」
會議室里安靜了大約五秒。林薇放下雷射筆,把天權6號的代工方案在腦子裡快速過了一遍。天權6號的目標工藝節點在國內代工廠目前公開的量產能力範圍之外,流片依賴境外代工資源。實體清單一旦落地,代工通道可能在兩周內被切斷。如果代工在預調度模型重新訓練完成之前就被切斷,那預調度模型訓得再好也沒有用武之地。
「所以測試時間壓縮不能只靠租設備。」林薇走到白板前,拿起記號筆開始畫一個並行推進的時間軸。「第一條線,天權4號極限溫度測試,三周內完成五百顆晶片的數據採集。第二條線,趙靜團隊在數據採集的同時用前一百顆的數據先做一輪預訓練,不等全部五百顆。第三條線——也是最關鍵的一條——張京京從電路設計層面,在RTL凍結的約束下,找出一條不依賴預調度模型的功耗壓制路徑。」
張京京抬起頭。RTL凍結意味著寄存器的邏輯設計已經鎖死,不能再改。但電路設計不止RTL一層,在RTL之下的物理設計層面,還有一些可以調整的變量——時鐘樹的驅動強度、緩衝器的級數、電源網絡的分區開關時序。
「異構互聯總線的電流尖峰根源是總線事務並發導致的瞬時開關電流疊加。預調度模型的做法是在尖峰來臨前插入等待周期,用吞吐率的微小損失換功耗峰值的安全裕量。但如果從物理設計層面,把總線事務的時鐘邊沿在十二個事務通道之間錯開零點幾個時鐘周期,讓開關電流的峰值在時間軸上自然分散,尖峰就能被壓平。這個方案不涉及RTL修改,只需要在物理設計的時鐘樹綜合階段增加一組分通道的時鐘偏斜約束。」
林薇在白板上把張京京的方案畫成了一張時序圖。十二條總線事務通道的時鐘邊沿原本全部對齊,開關電流在同一時刻疊加,形成尖峰。如果給每條通道引入一個遞增的時鐘偏斜——第一條通道零偏斜,第二條偏斜零點零三個時鐘周期,第三條偏斜零點零六個,以此類推——十二條通道的開關電流就會在時間軸上均勻分布,峰值自然下降。
「理論可行,但代價是什麼?」章宸問。
「最大偏斜量零點三三個時鐘周期,在建立時間裕量內可以消化。代價是總線事務的完成時間增加了零點三三個周期,吞吐率下降大約百分之零點三,比預調度模型的百分之零點七更小。」張京京把數字列在白板上,「更重要的是,這個方案和預調度模型不衝突。兩條路徑可以疊加——時鐘偏斜在物理層面削減尖峰的基礎峰值,預調度模型在邏輯層面處理剩餘的高峰事件。疊加之後,即使預調度模型的準確率在125度下暫時只有百分之八十三點七,物理層面的偏斜方案也能把漏報時尖峰的起點從58瓦壓低到52瓦左右,52瓦到43瓦之間的差距由正在校準中的預調度模型覆蓋。」
林薇在白板上的方案旁邊寫了一行字:「雙路徑協同——物理時鐘偏斜壓低基礎峰值+AI預調度模型壓制剩餘尖峰。」然後她用一條線把這句話和陳醒剛才問的實體清單問題連在一起。「雙路徑的好處不只是技術上的。如果實體清單落地,預調度模型的雲端重訓練資源可能受限——代工廠的斷供往往會連帶EDA工具和雲端算力服務的出口管制收緊。但物理時鐘偏斜方案不依賴任何外部工具和算力,它只需要我們在自己的物理設計環境裡調整一組約束參數。它是功耗優化攻關中唯一一條完全自主可控的路徑。」
陳醒在筆記本上寫了三個字:「自主可控。」然後抬頭看向章宸。「雙路徑方案批准。時鐘偏斜方案由張京京在物理設計階段落地,不增加流片周期。預調度模型重新訓練由趙靜在三周內完成,蘇黛批租用測試設備的預算。兩條路徑互為備份,但自主可控的那條優先級更高。」
散會後趙靜沒有立刻離開。她坐在會議室里,把張京京提出的時鐘偏斜方案的物理實現細節在腦子裡過了一遍,然後打開終端給張京京發了一條消息:「時鐘偏斜方案如果落地,預調度模型的輸入特徵可以減少一維——總線事務的時間聚集度會因為偏斜而自然降低,模型不需要再預測事務並發引起的疊加效應,只需要聚焦在單通道的大電流事務上。模型結構可以簡化,推理延遲能進一步壓縮。」
張京京的回覆在三十秒後到了:「簡化後的模型推理延遲能壓到多少?」
「兩點五納秒,比現在的三點二納秒再快零點七納秒。這對削峰響應速度的提升是決定性的。」
張京京看著那串數字,在剛剛攤開的物理設計草圖上用鉛筆標註了一個新的約束條件:時鐘偏斜步長零點零三個周期,總偏斜範圍零點三三個周期,最大吞吐率損失控制在百分之零點三以內。然後她在草圖底部寫了一行字作為設計準則:「物理層解決物理層能解決的問題,算法層解決算法層能解決的問題,兩層之間不互相等。」
當天下午,蘇黛批下來的一百二十萬測試設備租賃預算到了梁志遠的帳上。合城本地那家第三方檢測實驗室的兩台極限溫度測試設備在傍晚六點正式排入追光四期的測試資源池,與追光四期自有的那台設備組成三台並行的測試陣列。第一批一百顆天權4號晶片從庫存中調撥出來,貼上測試批次的標籤,在晚上九點整裝入三台設備的測試腔體。測試程序設定為從負40度到125度的全溫度梯度掃描,每個溫度點停留三十分鐘,採集全部八個負載檔位的總線電流波形,採樣頻率設定在十兆赫茲——這個頻率能捕捉到納秒級的電流尖峰。
趙靜把測試數據實時回傳的接口接入了小芯AI團隊的工作站,第一批一百顆晶片的低溫段數據在凌晨兩點開始陸續到達。她安排了兩個研究員輪流值班盯數據質量,同時在模型訓練框架中預設了一組新的特徵變換函數——專門針對125度高溫區電晶體漏電分量的非線性特性建模。這組函數的設計思路來自林薇在會上指出的根因:溫度升高導致閾值電壓下降,關斷漏電呈指數級上升。指數函數的參數需要從實測數據中擬合,但函數形式是確定的。把確定的物理先驗知識嵌入模型結構,可以顯著減少模型對訓練數據量的需求,就像張京京把物理層的確定性交給時鐘偏斜,把不確定性交給預調度模型一樣。
凌晨三點,趙靜在值班日誌上寫了一行記錄:「雙路徑思路的核心價值不在於多了一條備份路線,而在於兩條路徑各自解決各自擅長的問題。物理方案解決確定性問題,AI方案解決統計性問題。這是天權6號功耗曲線優化攻關的方法論——以後天權7號的3D堆疊功耗問題,也可以沿用這個方法論。」
她把日誌存檔,抬頭看了一眼工作站屏幕上正在跳動的一排排數據曲線。第一批測試晶片在125度下的總線電流波形已經開始陸續回傳,屏幕上的三維散點圖中,高溫區的非線性簇正在以每小時幾十個數據點的速度密集填充。三周後,這些數據將訓練出一個能在125度極端工況下準確預測電流尖峰的AI模型。而張京京的時鐘偏斜方案將在物理設計完成後,和這個AI模型在仿真環境中完成第一次協同驗證。
走廊盡頭的封閉開發區里,張京京工位上的燈還亮著。她的物理設計草圖上,十二條總線事務通道的時鐘偏斜約束已經標註完畢,旁邊用紅筆寫了一行備註:「偏斜約束依賴時鐘樹綜合工具的本地部署版本,不依賴外部EDA雲服務。」在她手邊,追光四期中控室剛剛傳來的一份簡報名為「國產化試產晶圓電性老化測試最終結果」——首批十二片晶圓的168小時老化測試全部通過,良率穩定在92.1%,金屬互連電阻偏差的那片晶圓在老化過程中沒有出現性能退化。簡報末尾附了梁志遠的一句話:「國產化產線已具備持續產出能力,可為天權6號樣片回片後的量產測試提供完全自主可控的測試環境。」
張京京看完簡報,在物理設計草圖的「時鐘偏斜約束」旁邊又加了一行字:「從流片到量產,每一條技術路徑都要有國產化的備份方案。」然後她合上草圖,起身走向走廊盡頭的咖啡機。窗外夜色正濃,追光四期的潔淨車間燈火通明,中央研究院的屏幕牆上,天權6號的版圖正在一塊一塊地拼接成形。