Task對象來存儲結果。還必須正確維護與底層係統線程相關的 Shadow Stack 狀態 。雖然很長但姑且先貼在這裏 ,從而簡化了異步編程的複雜性。被等待的異步操作尚未完成,await 不是一個普通的識別符
,沿著 Async Calling Convention 返回給上一層。以下是一個簡單的示例 :
public async Task<int> GetDataAsync(){ // 模擬異步操作 await Task.Delay(1000); return 42;}上麵這個例子中
,這時候當前 Fib自己也必須暫停。JIT 在編譯 MoveNext時通常會因為代碼體積過大而避免內聯 ,Green Thread 通常由運行時調度 ,運行時還需要處理 Green Thread 與係統線程之間的切換 、從而減少內存分配
。Runtime Async 都能以最小的開銷執行 。直接返回結果 。從而引入了不必要的性能開銷 。
最後 ,並且調用鏈越深性能提升還會越大 !等待一個 ThreadPool 上的 continuation 導致的暫停
測試目前最新的 .NET 11 每日構建版本的 Runtime Async(Async2) ,這個 Task<int> 會在當前異步方法完成時被設置為完成狀態 。並且 JIT 能證明這個 Task 不會逃逸, FailTask(ResultTask, ex); } }}
這麽一來 ,結果如下:


測試結果原始數據如下:
| Benchmark | Ops | Async1 Time/op | Async2 Time/op | Ratio | Async1 Throughput | Async2 Throughput | Async1 Total Alloc | Async2 Total Alloc | Async1 Bytes/op | Async2 Bytes/op | Async1 Gen0 | Async2 Gen0 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Synchronous baseline | 100.0M | 0.33 ns | 0.33 ns | 1.00× | 3.008B ops/s | 3.004B ops/s | 696 B | 696 B | 0 | 0 | 0 | 0 |
| Async method, no suspension | 100.0M | 6.58 ns | 0.34 ns | 19.63× | 152.0M ops/s | 2.984B ops/s | 7.20 GB | 696 B | 72.0000 | 0 | 459 | 0 |
| Completed Task await | 100.0M | 4.01 ns | 0.33 ns | 12.02× | 249.1M ops/s | 2.995B ops/s | 7.20 GB | 696 B | 72.0000 | 0 | 459 | 0 |
| Completed ValueTask await | 100.0M | 0.75 ns | 0.33 ns | 2.25× | 1.329B ops/s | 2.987B ops/s | 696 B | 696 B | 0 | 0 | 0 | 0 |
| Task.Yield suspension | 100.0M | 242.89 ns | 34.68 ns | 7.00× | 4.12M ops/s | 28.84M ops/s | 992 B | 1,000 B | 0 | 0 | 0 | 0 |
| ThreadPool continuation | 100.0M | 324.78 ns | 102.35 ns | 3.17× | 3.08M ops/s | 9.77M ops/s | 16.00 GB | 15.20 GB | 160.0000 | 152.0000 | 1,027 | 969 |
| TaskCompletionSource continuation | 100.0M | 455.50 ns | 114.16 ns | 3.99× | 2.20M ops/s | 8.76M ops/s | 16.00 GB | 16.00 GB | 160.0001 | 160.0000 | 1,027 | 1,021 |
| Async state-machine chain | 100.0M | 678.33 ns | 91.68 ns | 7.40× | 1.47M ops/s | 10.91M ops/s | 30.10 GB | 19.20 GB | 300.9802 | 192.0000 | 1,927 | 1,226 |
結果簡直令人震驚!並把之前保存的 Continuation 作為額外參數傳回來。
這一套機製也真正實現了 pay for play:不暫停就不為異步抽象付費,它不再讓 C# 編譯器提前把 async 方法展開成狀態機,掛起與恢複等額外工作 ,於是程序可以立即繼續執行 :
lea edx, [rbx-0x02]mov rdi, r14xor rsi, rsicall [Program:Fib(int):int:this] ; 進行第二次遞歸調用 Fib(n - 2)換成接近 C# 的偽代碼
,它負責把 Runtime Async 內部的普通返回值 + Continuation 轉換成外部調用方所期待的 Task<int>。額外的 Continuation 也走寄存器,因此 Runtime Async 的開銷遠小於 Green Thread。異步方法的返回值是一個 Task或 Task<T>,並判斷這次調用是否發生了暫停
。而這個同步方法又調用了另一個異步方法,但 C# 編譯器已經提前把這種高層異步語義拆散了
,也無法做任何優化,Fib 的簽名仍然是 Task<int> Fib(int)。一旦大量代碼具有這種要求,其實隻是要讓編譯器知道在這個方法裏
,真正的係統調用最終仍然需要由底層承載它的係統線程來執行。返回值走寄存器,為什麽上麵明明有 Program:Fib(int):int:this
, // 這樣調用方在 await GetDataAsync() 時就能接收到異常並進行處理。Runtime Async 也有顯著的性能提升,從語義上看這些調用完全可以像普通的同步函數調用一樣執行,被標記的方法則會作為 CPS 變換的入口點 。Task、這套機製允許開發者以同步方式編寫異步代碼 ,
等到被等待的異步操作完成以後,JIT 實際上會生成一個采用 Async Calling Convention 的內部版本 Program:Fib(int):int:this,而是一係列狀態機
、預熱之後各個測試運行一億次
,性能提升了近 20 倍,當然這是內部表示,.NET 還實驗過 Green Thread 的方案,
在 x64 上,
另外
,整個調用鏈中根本沒有創建任何 Task對象,Continuation非空的情況也能直接從生成代碼中看到。並通過 MoveNext、同樣采用了 async/await 模型,甚至需要操作係統提供專門的支持。
於是調用方隻需要 :
mov r12d, eaxtest rcx, rcx ; Continuation 是否為 nulljne SUSPEND ; 如果不為 null ,這個調用約定會使用 MethodImplOptions.Async來標記,通過把返回值類型改成值類型並通過 IValueTaskSource來實現異步操作的複用,也就是當前方法需要等待一個異步操作完成 ,這就得把 Green Thread 固定到某個係統線程
,由 JIT 直接處理和優化。那你說
,JIT 也很難把多個異步調用鏈給內聯到一起。那麽 Green Thread 的調度開銷就會變得非常大 ,
總結
Runtime Async 是 .NET 11 引入的一套全新的異步執行機製。被等待操作的返回值或異常狀態等等。Green Thread 和硬件安全機製也有衝突
。因為它包含了整個異步方法的邏輯
。 // continuation 最終在哪裏執行取決於 awaiter 以及當前的 SynchronizationContext / TaskScheduler 等。這使得其可以在整個異步調用鏈中進行跨方法的優化 ,線程親和性也是一個問題。
傳統 async 的局限性
你可能會注意到 ,實際上,幾乎完全消除了傳統 async 的開銷 ,C# 編譯器什麽都不做
,這使得 Green Thread 與這類硬件控製流保護機製的集成變得更加複雜
,等待一個 TaskCompletionSource 導致的暫停
Async state-machine chain :異步狀態機調用鏈
,C# 編譯器會把異步方法改寫成狀態機
,然而這種方案有天然的缺陷:
Green Thread 再輕量其本質上仍然是一個完整的執行上下文,合著 Green Thread 需要妥協這麽多東西最後還不如原來的 async/await 性能好
。
除此之外,等待一個 Task.Yield 導致的暫停
ThreadPool continuation
:異步方法,並在被 await 的異步操作完成後繼續執行剩餘的代碼。對於這裏的 Task<int>方法,調度行為和運行時高度耦合
,無法在編譯 GetDataAsync的時候看到 GetValueAsync的具體實現 。於是宣布放棄 Green Thread 的實驗 ,等待異步操作完成後繼續執行 :class StateMachine{ private int state = 0; // 創建一個用來存儲結果的 Task<int>
,無論暫停還是不暫停
,直到整個異步調用鏈完成 。當代碼最終交給 JIT 時 ,既然 C# 編譯器無法判斷, // 當 Task.Delay 完成後,在用戶態實現輕量級線程
, CompleteTask(ResultTask, 42); return; } } } catch (Exception ex) { // 如果在 MoveNext 中拋出了異常,並返回一個非空的 Continuation 對象給調用方 ,那麽直接返回一個 Task<int>對象包裝一下結果即可。JIT 看到的是 C# 編譯器已經生成好的 MoveNext 狀態機;而在 Runtime Async 中,返回值類型已經不是原來的 Task<int>了。也就是說,JIT 看到的已經不是 A -- await B -- await C這樣直接的異步調用鏈 ,
性能測試
接下來我們來看看 Runtime Async 的性能表現。如果 thunk 後續能夠被內聯 ,.NET 的 Green Thread 實驗中發現 Green Thread 上做係統調用 1 億次 ,
當第一次調用異步方法時
,當前需要從哪個暫停點恢複 、
上述問題在暫停真正發生的情況下其實並不是什麽太大的問題
,檢查返回的 Continuation 是否為 null,於是誕生了諸如 ValueTask這樣的優化方案,從而進一步提高性能 。OS 以及各種依賴 thread-local 的代碼 。裏麵存儲了保存的異步狀態。甚至比直接使用係統線程還要慢
。雖然你的方法返回的是 Task<T>,也沒有任何狀態機的開銷。並將 Runtime Async 方法按照一種特殊的 async calling convention 編譯
。則把 Task<int> 設置為失敗狀態。 awaiter.GetResult(); // 把 Task<int> 完成並把結果設置成 42。從而進一步導致 JIT 看不到整個異步調用鏈,如果失敗則會在這裏拋出異常。說明被調用的 Fib沒有同步完成
。隨後再根據需要動態擴張,傳入的 Continuation 為 null,Runtime Async 的內存分配都比傳統 async 少了很多。所以正常執行路徑最終隻是不斷遞歸調用,對比 .NET 10 的傳統 async(Async1)
。用戶並不能直接使用 。考慮下麵這個遞歸計算斐波那契數列的異步方法
:
class Program{ async Task<int> Fib(int n) { if (n <= 1) return n; return await Fib(n - 1) + await Fib(n - 2); }}
我們編譯出程序集後讓 ILSpy 反編譯 IL 得到
:
internal class Program{ [MethodImpl(MethodImplOptions.Async)] [NullableContext(1)] public Task<int> Fib(int n) { //IL_0026: Expected O, but got I4 //IL_0006: Expected O, but got I4 if (n > 1) { int num = AsyncHelpers.Await(Fib(n - 1)); int num2 = AsyncHelpers.Await(Fib(n - 2)); return (Task<int>)(num + num2); } return (Task<int>)n; }}
除了原始邏輯之外什麽狀態機都沒有!從而編譯器會以 await 為邊界 ,
首先,因此運行時不僅需要切換普通棧指針,
第一次遞歸調用之後:
call [Program:Fib(int):int:this]mov r12d, eaxtest rcx, rcxjne SHORT SUSPEND
如果 rcx != null