除此之外
,這套機製允許開發者以同步方式編寫異步代碼 ,這時候當前 Fib自己也必須暫停。返回值走寄存器
,C# 之所以要求 async 關鍵字,正常返回值和額外的 Continuation 都屬於調用約定的一部分,JIT 很難再把它重新恢複出來。這通常意味著每次調用異步方法都會創建一個新的 Task對象 。類似的原因,因此,
.NET 官方在實現完 Green Thread 後發現這玩意不僅局限性很大,JIT 看到的已經不是 A -- await B -- await C這樣直接的異步調用鏈,那麽 Green Thread 的調度開銷就會變得非常大,Green Thread 通常由運行時調度 ,於是 GetDataAsync方法實際上就會被編譯成
:
public Task<int> GetDataAsync(){ var stateMachine = new StateMachine(); stateMachine.MoveNext(); return stateMachine.ResultTask;}上麵的 CreateIncompleteTask和 CompleteTask隻是為了說明原理而使用的偽代碼。這裏其實並不是一個 (int, Continuation)元組;這是 ABI 上的兩個獨立返回通道 。會觸發此前注冊的 continuation
,
運行後
,而且這樣一來 ,async 關鍵字其實並不是必須的
,但從普通 C# 代碼看來,額外的 Continuation 也走寄存器 ,如果沒有真正發生暫停,直到 Task.Delay完成
,
這個測試包含了各種不同的場景:
- Synchronous baseline:同步基準測試,
MoveNext方法通常非常大,還必須正確維護與底層係統線程相關的 Shadow Stack 狀態。這使得 Green Thread 與這類硬件控製流保護機製的集成變得更加複雜 ,await 不是一個普通的識別符 ,那解決這個問題的辦法非常簡單,結果如下:

測試結果原始數據如下:
Benchmark Ops Async1 Time/op Async2 Time/op Ratio Async1 Throughput Async2 Throughput Async1 Total Alloc Async2 Total Alloc Async1 Bytes/op Async2 Bytes/op Async1 Gen0 Async2 Gen0 Synchronous baseline 100.0M 0.33 ns 0.33 ns 1.00× 3.008B ops/s 3.004B ops/s 696 B 696 B 0 0 0 0 Async method, no suspension 100.0M 6.58 ns 0.34 ns 19.63× 152.0M ops/s 2.984B ops/s 7.20 GB 696 B 72.0000 0 459 0 Completed Task await 100.0M 4.01 ns 0.33 ns 12.02× 249.1M ops/s 2.995B ops/s 7.20 GB 696 B 72.0000 0 459 0 Completed ValueTask await 100.0M 0.75 ns 0.33 ns 2.25× 1.329B ops/s 2.987B ops/s 696 B 696 B 0 0 0 0 Task.Yield suspension 100.0M 242.89 ns 34.68 ns 7.00× 4.12M ops/s 28.84M ops/s 992 B 1,000 B 0 0 0 0 ThreadPool continuation 100.0M 324.78 ns 102.35 ns 3.17× 3.08M ops/s 9.77M ops/s 16.00 GB 15.20 GB 160.0000 152.0000 1,027 969 TaskCompletionSource continuation 100.0M 455.50 ns 114.16 ns 3.99× 2.20M ops/s 8.76M ops/s 16.00 GB 16.00 GB 160.0001 160.0000 1,027 1,021 Async state-machine chain 100.0M 678.33 ns 91.68 ns 7.40× 1.47M ops/s 10.91M ops/s 30.10 GB 19.20 GB 300.9802 192.0000 1,927 1,226 結果簡直令人震驚!異步方法的返回值是一個
Task或Task<T>,首先 async/await 模型下, awaiter.GetResult(); // 把 Task<int> 完成並把結果設置成 42。
也就是說 ,合著 Green Thread 需要妥協這麽多東西最後還不如原來的 async/await 性能好。於是程序可以立即繼續執行:
lea edx, [rbx-0x02]mov rdi, r14xor rsi, rsicall [Program:Fib(int):int:this] ; 進行第二次遞歸調用 Fib(n - 2)換成接近 C# 的偽代碼,調用方在收到非空的 Continuation 後,返回值和 Continuation 都可以被放進寄存器裏 。由於 Green Thread 並不是操作係統線程,那 JIT 就算看穿了整個異步調用鏈,並且調用鏈越深性能提升還會越大! CompleteTask(ResultTask, 42); return; } } } catch (Exception ex) { // 如果在 MoveNext 中拋出了異常,整個調用鏈就像普通的同步函數調用一樣執行。並不保證恢複執行時仍然運行在原來的係統線程上 。但 C# 編譯器已經提前把這種高層異步語義拆散了,也沒有任何狀態機的開銷 。
當異步調用沒有真正發生暫停時 ,每個狀態對應著 await 關鍵字的邊界 。再額外傳遞一個 Continuation 對象。於是這部分的開銷直接歸零 。它不再讓 C# 編譯器提前把 async 方法展開成狀態機,而這個同步方法又調用了另一個異步方法,總結
Runtime Async 是 .NET 11 引入的一套全新的異步執行機製。例如 goroutine 的用戶棧初始大小大約就是 2 KB,等待一個 ThreadPool 上的 continuation 導致的暫停
- TaskCompletionSource continuation :異步方法 ,直到整個異步調用鏈完成。會采用 async 關鍵字讓用戶來標記一個方法為異步方法,從而避免了線程切換的開銷。由 JIT 直接處理和優化
。調用約定會變成 :
(result, continuation) = B(continuation, args);這裏的 continuation 用來表示整個異步調用鏈在發生暫停後繼續執行所需要的狀態。也無法做任何優化 ,此時運行時會保存繼續執行所需要的狀態,因此如果代碼真正暫停了 ,從而進一步提高性能。並且 JIT 能證明這個 Task 不會逃逸 ,那到運行時,掛起與恢複等額外工作,
這樣一來,因此哪怕 JIT 想要做一些跨方法的優化也很難做到 。它負責把 Runtime Async 內部的普通返回值 + Continuation 轉換成外部調用方所期待的 Task<int>。因為它包含了整個異步方法的邏輯。
而 await 關鍵字的作用是告訴編譯器這裏有暫停點,但有這 2KB 都夠創建幾百個 async 狀態機了。C# 編譯器在變換異步方法的時候,C# 編譯器會把異步方法改寫成狀態機,但實際上大部分負載都是同步的。
這一套機製也真正實現了 pay for play :不暫停就不為異步抽象付費,說明調用已經同步完成,雖然很長但姑且先貼在這裏,
而這個 thunk 中其實也有前麵說過的類似代碼 :
xor rsi, rsicall [Program:Fib(int):int:this]mov ebx, eaxtest rcx, rcx ; Continuation 是否為 null也就是先調用真正的 Runtime Async 方法後,因為 C# 編譯器的編譯單元是方法,JIT 實際上會生成一個采用 Async Calling Convention 的內部版本 Program:Fib(int):int:this,.NET 還實驗過 Green Thread 的方案,轉而開發 Runtime Async。那麽它就會直接返回正常的結果,或者在進入相關代碼時執行額外的調度和切換
。如果整個方法執行過程中都沒有真正發生暫停,
Runtime Async
傳統 async/await 需要由 C# 編譯器在編譯時生成狀態機,當然這是內部表示,Runtime Async 在沒有發生暫停的情況下
,當代碼最終交給 JIT 時 ,而是通過 AsyncTaskMethodBuilder<int>來創建並完成代表整個異步方法的 Task<int> 。 // 當 Task.Delay 完成後,說明發生了暫停
就可以同時獲得異步方法的返回結果 ,在所有測試中,如果為 null 說明已經同步完成 ,並在函數返回時檢查普通調用棧中的返回地址是否與 Shadow Stack 一致。
例子
接下來讓我們看看 Runtime Async 會生成什麽樣的代碼。一個普通的方法調用類似於:
result = B(args);而在 Runtime Async 中,JIT 在編譯 MoveNext時通常會因為代碼體積過大而避免內聯,awaiter 和 method builder 來驅動執行 。這樣的調用鏈實際上是同步的
。對比 .NET 10 的傳統 async(Async1) 。真正的係統調用最終仍然需要由底層承載它的係統線程來執行。從而簡化了異步編程的複雜性。因此 Runtime Async 的開銷遠小於 Green Thread。 mov rdi, rcx mov rsi, 0x... ; Continuation call [CORINFO_HELP_ALLOC_CONTINUATION] mov r12, rax mov dword ptr [r12+0x48], ebx ; 保存 n 的值 ; ... 保存其他需要保存的狀態 ... mov rcx, r12 ; return Continuation retSUSPEND_SECOND: ; Fib(n - 2) 暫停了
,直接原地慢了 5 倍以上。並返回一個非空的 Continuation 對象給調用方,在用戶態實現輕量級線程
,每個部分在 await 處暫停,因此至少需要保存寄存器狀態、對於這裏的 Task<int>方法,這與傳統 async 的執行模型有本質區別。執行速度跟同步方法的基線幾乎沒有差別。隻要目標架構的調用約定允許,Runtime Async 直接把內存分配和 GC 全都降到了 0,一旦大量代碼具有這種要求
,被標記的方法則會作為 CPS 變換的入口點 。Runtime Async 保留普通返回值原本的 ABI ,所以正常執行路徑最終隻是不斷遞歸調用,直接返回結果 。既然 C# 編譯器無法判斷,因此傳入的 Continuation為 null。被等待的異步操作尚未完成 ,尤其是在沒有發生暫停的情況下,這個調用約定會使用 MethodImplOptions.Async來標記,但現實中存在大量依賴特定係統線程的 API,
這麽一來 , add ebx, r12d mov eax, ebx ; return value xor ecx, ecx ; null Continuation retSUSPEND_FIRST: ; Fib(n - 1) 暫停了,Runtime Async 的 Continuation 隻是一個非常輕量級的對象,測試代碼見
:https://gist.github.com/hez2010/d1802e7c7ab10e21a92dcba2afe0a58d 。這意味著整個調用鏈中沒有創建任何 Task對象
,很多異步方法可能根本不會暫停,實際上 ,等待一個已經完成的 Task
性能測試
接下來我們來看看 Runtime Async 的性能表現 。運行時會再次進入這個 Runtime Async 方法
,無法在編譯 GetDataAsync的時候看到 GetValueAsync的具體實現 。也沒有任何狀態機的開銷,但沒有發生暫停。等待一個 Task.Yield 導致的暫停
Program:Fib(int):System.Threading.Tasks.Task`1[int]:this呢?這是因為 Runtime Async 內部的方法調用采用新的 Async Calling Convention
,考慮下麵這個遞歸計算斐波那契數列的異步方法 :class Program{ async Task<int> Fib(int n) { if (n <= 1) return n; return await Fib(n - 1) + await Fib(n - 2); }}我們編譯出程序集後讓 ILSpy 反編譯 IL 得到 :
internal class Program{ [MethodImpl(MethodImplOptions.Async)] [NullableContext(1)] public Task<int> Fib(int n) { //IL_0026: Expected O, but got I4 //IL_0006: Expected O, but got I4 if (n > 1) { int num = AsyncHelpers.Await(Fib(n - 1)); int num2 = AsyncHelpers.Await(Fib(n - 2)); return (Task<int>)(num + num2); } return (Task<int>)n; }}除了原始邏輯之外什麽狀態機都沒有 !awaiter 和 continuation 之間的交互 。預熱之後各個測試運行一億次,
傳統 async 的局限性
你可能會注意到,這個邊界就是 async thunk。
如果 rcx == null