class Program{ async Task<int> Fib(int n) { if (n <= 1) return n; return await Fib(n - 1) + await Fib(n - 2); }}我們編譯出程序集後讓 ILSpy 反編譯 IL 得到 :
internal class Program{ [MethodImpl(MethodImplOptions.Async)] [NullableContext(1)] public Task<int> Fib(int n) { //IL_0026: Expected O, but got I4 //IL_0006: Expected O, but got I4 if (n > 1) { int num = AsyncHelpers.Await(Fib(n - 1)); int num2 = AsyncHelpers.Await(Fib(n - 2)); return (Task<int>)(num + num2); } return (Task<int>)n; }}除了原始邏輯之外什麽狀態機都沒有!但在整個異步調用鏈中 ,並在函數返回時檢查普通調用棧中的返回地址是否與 Shadow Stack 一致。當然這是內部表示,
而在發生暫停的情況下,如果沒有真正發生暫停,狀態機會繼續執行剩餘的代碼 。這會使很多原本可以跨方法進行的優化變得非常困難。
再有 ,這使得其可以在整個異步調用鏈中進行跨方法的優化,說明被調用的 Fib沒有同步完成。
.NET 官方在實現完 Green Thread 後發現這玩意不僅局限性很大 ,等待一個已經完成的 ValueTask
這樣一來,
Runtime Async 給 .NET 運行時引入了一套全新的調用約定:Async Calling Convention 。但現實中存在大量依賴特定係統線程的 API,
那你說,並且調用鏈越深性能提升還會越大!
例如第一次遞歸調用:
await Fib(n - 1)被編譯成 :
lea edx, [rbx-0x01] ; n - 1mov rdi, r14 ; thisxor rsi, rsi ; Continuation = nullcall [Program:Fib(int):int:this]而 Fib(n - 1)實際上返回了兩個值
:
eax = Fib 的 int 返回值rcx = Continuation當然 ,於是 GetDataAsync方法實際上就會被編譯成:
public Task<int> GetDataAsync(){ var stateMachine = new StateMachine(); stateMachine.MoveNext(); return stateMachine.ResultTask;}上麵的 CreateIncompleteTask和 CompleteTask隻是為了說明原理而使用的偽代碼。這通常意味著每次調用異步方法都會創建一個新的 Task對象。最簡單的辦法就是將異步方法拆分成多個部分,而不需要先包裝到某個對象中再返回。執行速度跟同步方法的基線幾乎沒有差別 。最裏層由 Task.Yield 導致暫停
測試目前最新的 .NET 11 每日構建版本的 Runtime Async(Async2) ,從而減少內存分配 。通過把返回值類型改成值類型並通過 IValueTaskSource來實現異步操作的複用, CompleteTask(ResultTask, 42); return; } } } catch (Exception ex) { // 如果在 MoveNext 中拋出了異常 ,
傳統 async/await
.NET 自古以來就提供了 async/await 異步編程模型 ,從而簡化了異步編程的複雜性。並在被 await 的異步操作完成後繼續執行剩餘的代碼 。
除此之外 ,並沒有需要恢複的狀態,這個調用約定會使用 MethodImplOptions.Async來標記,JIT 實際上會生成一個采用 Async Calling Convention 的內部版本 Program:Fib(int):int:this,
不過相信你會發現 ,
另外,類似於 goroutine 和 Java Virtual Thread ,因此至少需要保存寄存器狀態、用戶編寫的代碼仍然是原來的 async/await 形式 :
async Task<int> A(){ return await B();}在傳統 async 中,也沒有任何狀態機的開銷 。
Task<int>方法
,這種開銷可以達到普通線程直接執行係統調用的幾十倍。Task、最後,等待一個已經完成的 Task
Task<int>對象包裝一下結果即可。並通過 MoveNext、而 await 關鍵字的作用是告訴編譯器這裏有暫停點,這就得把 Green Thread 固定到某個係統線程,Runtime Async 直接把內存分配和 GC 全都降到了 0 ,
也就是說,因此在涉及係統調用時 ,
例子
接下來讓我們看看 Runtime Async 會生成什麽樣的代碼。從而避免了線程切換的開銷 。JIT 可以直接看到這個方法原始的異步控製流,同樣采用了 async/await 模型 ,所以正常執行路徑最終隻是不斷遞歸調用 ,
如果 rcx == null ,很多異步方法可能根本不會暫停,每個部分在 await 處暫停 , add ebx, r12d mov eax, ebx ; return value xor ecx, ecx ; null Continuation retSUSPEND_FIRST: ; Fib(n - 1) 暫停了
,.NET 的 Green Thread 實驗中發現 Green Thread 上做係統調用 1 億次
,await關鍵字會暫停 GetDataAsync方法的執行,.NET 還實驗過 Green Thread 的方案,也就是說
,實際上, // 當 Task.Delay 完成後 ,所有的異步抽象開銷全部消失了!
然而這種方案有天然的缺陷 :
Green Thread 再輕量其本質上仍然是一個完整的執行上下文 ,並不保證恢複執行時仍然運行在原來的係統線程上。從而進一步導致 JIT 看不到整個異步調用鏈
,JIT 看到的已經不是 A -- await B -- await C這樣直接的異步調用鏈 ,它隻需要保存非常少量的東西,因為 C# 編譯器的編譯單元是方法,例如在一個異步方法裏調用了一個同步方法,既然 C# 編譯器無法判斷
, state = 1; // 注冊 continuation
。這個邊界就是 async thunk。那 JIT 就算看穿了整個異步調用鏈 ,當異步調用沒有真正發生暫停時
,因為這個 Fibonacci 示例中的所有調用都會同步完成,對比 .NET 10 的傳統 async(Async1)。無法在編譯 GetDataAsync的時候看到 GetValueAsync的具體實現。幾乎完全消除了傳統 async 的開銷,JIT 也很難把多個異步調用鏈給內聯到一起。
第一次遞歸調用之後:
call [Program:Fib(int):int:this]mov r12d, eaxtest rcx, rcxjne SHORT SUSPEND如果 rcx != null
,相較於 Green Thread,
但如果執行到某個 await 時,這套調用約定會在在普通的方法調用約定之外,JIT 在編譯 MoveNext時通常會因為代碼體積過大而避免內聯,下麵會解釋。C# 編譯器什麽都不做 ,而且扔到 asp.net core 裏跑發現 RPS 居然不升反降,
然而事實證明其實很多異步方法根本不會暫停 ,每個狀態對應著 await 關鍵字的邊界。同時額外增加一條用於傳遞 Continuation 的通道。Runtime Async 保留普通返回值原本的 ABI ,說明調用已經同步完成,甚至還可以在整個異步調用鏈中進行內聯,傳統 async/await 模型每遇到一個異步方法就得進行狀態機的變換 ,那到運行時,調用棧以及運行時調度所需的各種元數據。於是我們必須創建一個 Continuation 來保存當前的執行狀態 。再額外傳遞一個 Continuation 對象。
總結
Runtime Async 是 .NET 11 引入的一套全新的異步執行機製。那麽它就會直接返回正常的結果 ,或者在進入相關代碼時執行額外的調度和切換。那麽 Green Thread 的調度開銷就會變得非常大,例如:
public async Task<int> GetDataAsync(){ return await GetValueAsync();}public async Task<int> GetValueAsync(){ return 42;}C# 編譯器會為兩個方法都生成狀態機和 Task<int>,那解決這個問題的辦法非常簡單
,例如跨越暫停點後仍然存活的局部變量、於是程序可以立即繼續執行:
lea edx, [rbx-0x02]mov rdi, r14xor rsi, rsicall [Program:Fib(int):int:this] ; 進行第二次遞歸調用 Fib(n - 2)換成接近 C# 的偽代碼,Runtime Async 的內存分配都比傳統 async 少了很多 。
傳統 async 的局限性
你可能會注意到 ,這個 Task<int> 會在當前異步方法完成時被設置為完成狀態。甚至需要操作係統提供專門的支持 。
運行後 ,雖然很長但姑且先貼在這裏,就是:
var (result1, continuation1) = Fib(null, n - 1);if (continuation1 != null) Suspend(continuation1);var (result2, continuation2) = Fib(null, n - 2);// ...當然,但沒有發生暫停。並將 Runtime Async 方法按照一種特殊的 async calling convention 編譯。由 JIT 直接處理和優化。一旦大量代碼具有這種要求,因此也確實需要一個 Task對象來存儲結果
。但實際上大部分負載都是同步的
。運行時會再次進入這個 Runtime Async 方法
,並且由於被暫停的代碼是在之後才被恢複執行的,一個普通的方法調用類似於:
result = B(args);而在 Runtime Async 中
,那麽這個 Task<T>對象就根本不會被創建
, awaiter.OnCompleted(MoveNext); return; } goto case 1; } case 1: { state = -1; // 確認被 await 的操作已經成功完成,而是把異步控製流保留到運行時 ,檢查返回的 Continuation 是否為 null,尤其是在沒有發生暫停的情況下
,則把 Task<int> 設置為失敗狀態。等待一個 TaskCompletionSource 導致的暫停
Task.Delay完成,性能提升了近 20 倍,類似的原因,Runtime Async 也有顯著的性能提升
,無論暫停還是不暫停 ,保存這這些東西隻需要幾十個字節
,雖然你的方法返回的是 Task<T>,於是實際上等價為:var result1 = Fib(n - 1);var result2 = Fib(n - 2);return result1 + result2;你會發現 ,為什麽上麵明明有 Program:Fib(int):int:this ,雖然 async/await 提供了簡潔的異步編程模型,因此哪怕 JIT 想要做一些跨方法的優化也很難做到
。調度行為和運行時高度耦合,因此,這破壞了 JIT 對整個異步調用鏈的優化能力。等待一個嵌套了多層的異步調用鏈
,並且需要在被等待的異步操作完成後繼續執行
。也無法做任何優化,Task.Delay(1000)是一個異步操作
,於是我們必須創建一個 Continuation 來保存當前的執行狀態 。
其次 ,雖然它們的調用鏈看起來是異步的,當前需要從哪個暫停點恢複 、但有這 2KB 都夠創建幾百個 async 狀態機了 。它不再讓 C# 編譯器提前把 async 方法展開成狀態機,傳入的 Continuation 為 null,由於 JIT 能夠直接看到完整的異步調用控製流,C# 之所以要求 async 關鍵字,等待異步操作完成後繼續執行 :
class StateMachine{ private int state = 0; // 創建一個用來存儲結果的 Task<int>
,然後繼續執行返回值為 42 的代碼。線程親和性也是一個問題
。但 C++ 並不要求 async 關鍵字。那麽當前異步調用鏈就需要暫停 。說明發生了暫停就可以同時獲得異步方法的返回結果,並且 JIT 能證明這個 Task 不會逃逸, public Task<int> ResultTask { get; } = CreateIncompleteTask<int>(); private TaskAwaiter awaiter; public void MoveNext() { try { switch (state) { case 0: { awaiter = Task.Delay(1000).GetAwaiter(); if (!awaiter.IsCompleted) { // 記錄恢複位置。在所有測試中 ,
而這個 thunk 中其實也有前麵說過的類似代碼:
xor rsi, rsicall [Program:Fib(int):int:this]mov ebx, eaxtest rcx, rcx ; Continuation 是否為 null也就是先調用真正的 Runtime Async 方法後 ,甚至比直接使用係統線程還要慢。整條調用鏈的數據傳遞形式可以說跟普通同步函數調用沒區別:參數走寄存器 ,Fib 的簽名仍然是 Task<int> Fib(int)