Ai giữ thặng dư khi agent đóng ticket trong managed services

Cách đo ROI khi agent vào vận hành managed services, cho cả nhà cung cấp lẫn khách, dựa trên thặng dư mà hợp đồng và mức tự chủ chia cho hai phía.

Ai giữ thặng dư khi agent đóng ticket trong managed services
Photo by Ali Aziz / Unsplash

Một agent đóng một ticket thay cho kỹ sư L1 của nhà cung cấp managed services. Giờ người tiết kiệm được, nếu thành tiền, thì tiền vào túi nhà cung cấp hay túi khách hàng đang thuê họ?

Agent tạo ra đúng một thặng dư, ký hiệu \(S\), tính trên cả hệ gồm hai phía. Hợp đồng cộng mức tự chủ của agent quyết định mỗi phía giữ bao nhiêu phần của \(S\), và ROI mà một phía báo ra chỉ đo phần của phía đó.

Lợi ích và chi phí trong thặng dư Lợi ích trừ chi phí cho ; hợp đồng và mức tự chủ quyết định mỗi phía giữ bao nhiêu Giờ tiết kiệm thành tiền Chất lượng Tăng trưởng Xây Chạy agent Review và sửa sai Tri thức Rủi ro Chuyển đổi của khách : downtime tránh được thêm tenant, cùng headcount tích hợp, quy trình: mỗi item, cộng lại , trừ vào knowledge base, eval mỗi item, cộng lại Lợi ích Chi phí thặng dư Hợp đồng và mức tự chủ Nhà cung cấp Khách , , là chuyển giao: đổi phần chia, không đổi chia rủi ro giữa hai phía
Hình 1. Mọi lợi ích và chi phí đi vào \(S\) đúng một lần; hợp đồng và mức tự chủ đứng sau \(S\), nên chỉ đổi cách chia.

Định nghĩa ROI cho hai phía

Đặt \(\Delta\Pi_P\) là thay đổi lợi nhuận của nhà cung cấp, \(\Delta V_C\) là thay đổi giá trị ròng của khách khi agent vào vận hành. ROI của mỗi phía là NPV dòng tiền của phía đó chia cho giá trị hiện tại khoản chi của chính phía đó:

\[\text{ROI}_P = \frac{\text{NPV}(\Delta\Pi_P)}{\text{PV}(\text{chi}_P)}, \qquad \text{ROI}_C = \frac{\text{NPV}(\Delta V_C)}{\text{PV}(\text{chi}_C)}\]

Phần chia thặng dư chứng minh \(\Delta\Pi_P+\Delta V_C=S\) với mọi loại hợp đồng, nên hai tử số cộng lại là NPV của \(S\). Một ROI dựng cho một ticket giả định dễ bị đọc như lời hứa, đúng loại số mà phần NPV và ROI soi lại, nên thay cho ví dụ số là một item loại \(k\) (một alert, incident, service request hay change thuộc lớp việc \(k\)) đi qua mọi công thức dưới đây ở dạng ký hiệu; mỗi bên tự đặt số của mình vào widget ở cuối phần chia thặng dư.

Chi phí vận hành hiện tại

Dòng việc hiện tại qua L1, L2, L3 Mỗi lớp việc có item mỗi kỳ, giờ người mỗi item, giá một giờ người theo cấp xử lý Tín hiệu Lớp việc Nhà cung cấp, cấp xử lý L1 tới L3 Phía khách Toil nằm chủ yếu ở L1, L2 thủ công, lặp, tự động hoá được Monitoring Người dùng Alert Incident Service request Change tiếp nhận, xử lý chuẩn kỹ sư vận hành chuyên gia, đội ứng dụng Đội IT của khách L1 L2 L3 Đóng việc giá giờ thấp giá giờ vừa giá giờ cao chuyển tay chuyển tay item mỗi kỳ chi phí lao động mỗi kỳ khi chưa có agent cộng dồn giờ người ở mọi cấp item đi qua, kể cả giờ chuyển tay
Hình 2. Đường tới đóng việc nào cũng đi qua giờ người, mỗi lần chuyển tay cộng thêm giờ; chi phí trước khi có agent viết trọn được bằng khối lượng, giờ và giá giờ.

Lớp việc \(k\) có \(V_k\) item mỗi kỳ; mỗi item tốn \(h_k\) giờ người khi làm tay, cộng dồn qua L1, L2, L3 kể cả giờ chuyển tay; \(w_k\) là chi phí một giờ người có tải.

\[L = \sum_k V_k h_k w_k, \qquad \tau = \frac{H_{\text{toil}}}{H_{\text{eng}}}, \qquad \lambda = \frac{N}{\text{FTE}}\]

\[\text{CTS} = \frac{L + T + O}{N}, \qquad m = \frac{\text{Rev} - \text{COGS}}{\text{Rev}}\]

\(\tau\) là tỉ lệ giờ toil, \(N\) là số tenant, CTS là chi phí phục vụ một tenant với \(T\) chi phí công cụ và \(O\) chi phí chung, \(m\) là biên gộp.

Lương và phúc lợi chiếm 68,5 phần trăm chi phí service desk toàn cầu năm 2016 theo MetricNet, hãng bán dịch vụ benchmark [1] (bài 5/2017); biên gộp managed services trung bình là 46,2 phần trăm ở Q2 2024 theo Service Leadership, công ty con của ConnectWise [2] (thông cáo 6/8/2024). Suy luận: thay đổi ở \(h_k\) đi thẳng vào giá vốn của nhà cung cấp, và vào chính khoản giờ khách đang trả trên hoá đơn.

Cost per ticket là tổng chi phí vận hành tháng chia số ticket tháng [1], tức chi phí trung bình, không phải chi phí biên. Tử số chứa mặt bằng, công cụ, nhân sự gián tiếp, những khoản không giảm khi một ticket biến mất, nên lấy số ticket tránh được nhân cost per ticket không cho nhà cung cấp con số tiết kiệm, cũng không cho khách căn cứ đòi giảm giá (suy luận).

Ticket escalate cộng dồn chi phí qua từng cấp xử lý. MetricNet ước chi phí mỗi ticket ở Bắc Mỹ khoảng năm 2019 từ khoảng 22 USD ở L1 lên khoảng 100 USD ở L3 [3] (vlog 4/2020); trên 20 hệ thống của Microsoft, từ 4,11 tới 91,58 phần trăm incident bị gán lại ít nhất một lần [4] (ICSE-SEIP 2019). Suy luận: ranh giới chuyển tay giữa nhà cung cấp và đội IT của khách cộng thêm giờ vào giá vốn của phía này và vào MTTR của phía kia.

Vùng tô đỏ trên hình 2 là toil theo sách Site Reliability Engineering của Google: việc vận hành thủ công, lặp lại, tự động hoá được, tăng tuyến tính theo quy mô, với trần 50 phần trăm thời gian SRE [5] (bản online 2017); áp định nghĩa đó cho L1 và L2 của MSP là suy luận. Trước khi có agent, item loại \(k\) chỉ có \(V_k\), \(h_k\), \(w_k\) và \(a=0\), nên \(v=0\).

Giờ người và giá trị ròng của mỗi item

Cây xác suất của một item giao cho agent Một item của lớp , trong cây bỏ chỉ số ; rủi ro độc lập với Xác suất Giờ người Tiền ngoài lương Item lớp Giao agent Đúng Sai làm tay không hại không hại gây hại gây hại kỳ vọng giờ người theo năm lá giá trị ròng so với làm tay hết hoà vốn: chỗ
Hình 3. Cây \(a\), \(s\), \(q\) của một item: lá nào ngoài nhánh làm tay cũng mang giờ review, nên agent tốn giờ người cả khi làm đúng.

Item loại \(k\) nhận thêm bảy biến; bên trong một item ta bỏ chỉ số \(k\). \(a\) là xác suất item được giao cho agent, \(s\) là xác suất agent làm xong đúng và được kiểm chứng, \(r\) là giờ review mỗi item agent làm, \(e\) là giờ phạt thêm khi agent sai (phần làm lại tốn \(h\), tính riêng), \(c\) là chi phí chạy agent mỗi item, \(q\) là xác suất hành động của agent gây hại, \(D\) là thiệt hại kỳ vọng mỗi lần. Mô hình coi \(q\) độc lập với \(s\): một lần chạy đúng vẫn có thể có tác dụng phụ. Kỳ vọng giờ người theo năm lá:

\[E[H_k] = (1 - a)\,h + a\,\big[r + (1 - s)(h + e)\big]\]

So với mốc làm tay toàn bộ, tốn \(hw\) mỗi item, giá trị ròng của item là

\[v_k = a\,\big[w\,(s h - r - (1 - s) e) - c - q D\big]\]

và vì \(v_k\) tuyến tính theo \(s\), nghiệm duy nhất của \(v_k=0\) là ngưỡng hoà vốn:

\[s_k^* = \frac{r + e + (c + q D)/w}{h + e}\]

\(E[H_k]\), \(v_k\) và \(s_k^*\) là đồng nhất thức, dẫn xuất ở khối Đào sâu đầu tiên. Đặt \(\rho_r=r/h\), \(\rho_e=e/h\), \(\rho_c=c/(hw)\), \(\rho_D=qD/(hw)\), ta có dạng chuẩn hoá:

\[s^* = \frac{\rho_r + \rho_e + \rho_c + \rho_D}{1 + \rho_e}, \qquad \frac{v}{h w} = a\,(1 + \rho_e)\,(s - s^*)\]

Vế phải là một đường thẳng theo \(s\), độ dốc \(a(1+\rho_e)\), cắt 0 tại \(s^*\). Ba giới hạn: \(a=0\) cho \(v=0\); \(s=1\) với \(r=c=qD=0\) cho \(v=ahw\), tức agent hoàn hảo và miễn phí tiết kiệm đúng phần giờ được giao; \(s=0\) cho \(E[H]=h+a(r+e)\), lớn hơn \(h\), và \(v\) âm với đủ bốn khoản review, giờ phạt, chi phí chạy, rủi ro.

Trong dạng chuẩn hoá, \(a\) chỉ nhân độ lớn, không dời ngưỡng: giao nhiều việc hơn làm lãi to hơn khi \(s>s^*\) và lỗ nặng hơn khi \(s \lt s^*\), nên cả hai phía phải đọc dấu của \(s-s^*\) trước khi đọc tỉ lệ tự động hoá. \(s^*\ge 1\) khi và chỉ khi \(\rho_r+\rho_c+\rho_D\ge 1\): review cộng chi phí chạy cộng rủi ro đã đắt bằng làm tay thì lớp việc đó lỗ với mọi \(s\). Và vì \(s^*\ge \rho_e/(1+\rho_e)\), giờ phạt khi sai đặt một sàn cho ngưỡng.

Item loại \(k\) giữ \(q\), \(D\), \(e\) dương trong mọi công thức sau; cho chúng bằng 0 thì nhánh gây hại và cái sàn của ngưỡng biến mất. Chưa nguồn công khai nào đo \(r\) hay \(e\) cho ticket vận hành, nên mỗi bên tự đo chúng; điểm neo gần nhất đến từ việc khác: maintainer chấm một lời giải PR của model hết trung bình 3,5 phút trong thí nghiệm của METR [6] (2025).

Đổi giờ tiết kiệm thành tiền

Từ giờ tiết kiệm tới tiền Chỉ phần của đi qua ba kênh mới thành tiền thật Ba kênh làm giờ thành tiền giờ tiết kiệm phần thành tiền giảm hoặc hoãn tuyển cắt contractor thêm tenant, cùng headcount giờ chưa thành tiền người vẫn đó, lương vẫn trả tiền rời sổ sách chi phí chạy agent : chi phí giờ bình quân gia quyền theo giờ tiết kiệm Nhu cầu tiềm ẩn , một lớp làm tay: có agent: nhu cầu tăng: khi Hiệu ứng cơ cấu dễ, khó, agent khó, trước sau tổng mỗi tenant giảm chi phí mỗi ticket còn làm tay tăng mỗi ticket: lên so tổng trên tenant, không so mỗi ticket
Hình 4. Giờ chỉ rời sổ sách qua ba kênh, còn chi phí chạy agent luôn là tiền thật, nên tiền tiết kiệm có thể âm khi giờ tiết kiệm dương.

Cộng giờ tiết kiệm theo lớp việc, rồi đổi sang tiền:

\[\Delta H = \sum_k V_k\,(h_k - E[H_k]) = \sum_k V_k\,a_k\,\big[s_k h_k - r_k - (1 - s_k) e_k\big]\]

\[\Delta C = \rho_{\text{real}}\,\bar w\,\Delta H - C_{\text{agent}}\]

\[C_{\text{agent}} = \sum_k V_k a_k c_k, \qquad \bar w = \frac{\sum_k V_k w_k (h_k - E[H_k])}{\Delta H}\]

\(\rho_{\text{real}}\) là phần giờ tiết kiệm thật sự thành tiền; \(\bar w\) là chi phí giờ bình quân gia quyền theo giờ tiết kiệm, vì giờ L1 và giờ L3 không cùng giá. Rủi ro gộp lại là \(R=\sum_k V_k a_k q_k D_k\). Với \(\rho_{\text{real}}=1\) thì \(\Delta C-R=\sum_k V_k v_k\), tức tiền khớp đúng tổng giá trị ròng từng item và phần của item loại \(k\) là \(V_k v_k\); với \(\rho_{\text{real}}=0\) thì \(\Delta C=-C_{\text{agent}}\) và item đó chỉ còn \(-V_k a_k c_k\).

\(\rho_{\text{real}}\) dương qua đúng ba kênh: giảm hoặc hoãn tuyển, cắt contractor, thêm tenant với cùng headcount. Giờ không qua kênh nào thì người vẫn ngồi đó, lương vẫn trả; danh sách ba kênh là suy luận của người viết. Khi chỉ một phần giờ thành tiền, ngưỡng của cả hệ dời lên:

\[s^*_{\text{real}} = \frac{\rho_r + \rho_e + (\rho_c + \rho_D)/\rho_{\text{real}}}{1 + \rho_e}\]

\(\rho_{\text{real}}\) chỉ chia vào chi phí chạy và rủi ro, hai khoản ra khỏi túi dù giờ có được dùng lại hay không. \(s^*_{\text{real}}\ge 1\) khi \(\rho_{\text{real}}\le (\rho_c+\rho_D)/(1-\rho_r)\), và dưới mức đó không tỉ lệ thành công nào đủ. Người bán đọc ra rằng tự động hoá không kèm kế hoạch cho giờ được giải phóng là lỗ ở mọi \(s\); người mua đọc ra rằng một đề xuất chỉ báo giờ tiết kiệm chưa nói gì về hoá đơn.

Chỗ chưa chắc nhất của mô hình nằm ở tham số này. Chưa có nguồn độc lập nào đo \(\rho_{\text{real}}\) ở service desk hay MSP, tức chưa ai đo headcount và chi contractor trước và sau khi triển khai agent rồi đối chiếu với số giờ vendor báo. Thứ gần nhất là một khảo sát tự báo cáo ở mảng customer service: trong 321 lãnh đạo Gartner hỏi tháng 10/2025, 20 phần trăm nói đã giảm nhân sự nhờ AI, 55 phần trăm giữ nguyên nhân sự khi lượng khách tăng [7] (thông cáo 2025-12-02). Khảo sát đó chỉ cho hướng, nên \(\rho_{\text{real}}\) là tham số mỗi bên tự đo từ sổ lương và hợp đồng contractor của mình.

\(\Delta H\) cũng không lấy được từ khảo sát. Trong thử nghiệm ngẫu nhiên trên 16 dev, METR đo thời gian hoàn thành tăng 19 phần trăm khi dùng AI, trong khi các dev ước rằng họ nhanh hơn 20 phần trăm [8] (2025-07); bản cập nhật ngày 2026-02-24 cho kết quả khác với công cụ mới, và METR tự gọi đó là bằng chứng rất yếu [9]. Suy luận: \(h_k\) và \(r_k\) phải đo bằng thời gian thật trên ticket, có ngày đo. Khi người làm dùng trợ lý AI, thứ đổi là \(h\), không phải \(s\): trên 5.172 nhân viên hỗ trợ khách hàng, số vấn đề giải quyết mỗi giờ tăng 15 phần trăm [10] (QJE, 2025). Klarna tự quy đổi khối chat do AI xử lý thành số nhân viên tương đương năm 2024 [11] rồi tuyển lại người năm 2025 [12].

Nhu cầu tiềm ẩn làm giờ tiết kiệm nhỏ lại: khối lượng tăng lên \(V_k(1+\eta_k)\) khi dịch vụ nhanh và rẻ hơn, và

\[\Delta H_\eta = \sum_k V_k\,\big[h_k - (1 + \eta_k)\,E[H_k]\big]\]

về 0 tại \(\eta_k=(h_k-E[H_k])/E[H_k]\). KCS ghi rằng tổ chức support thường chỉ thấy dưới 3 phần trăm tổng nhu cầu support của khách [13] (trang cập nhật 2026-04-20). Suy luận: dưới hợp đồng theo ticket hay theo outcome, nhu cầu đó thành doanh thu của nhà cung cấp và hoá đơn lớn hơn của khách; dưới giá cố định, nó ăn vào giờ tiết kiệm của nhà cung cấp.

Giao hết lớp dễ, \(h_1 \lt h_2\), cho agent thì chi phí người mỗi ticket còn làm tay tăng trong khi tổng chi phí giảm, một hiệu ứng cơ cấu:

\[\frac{\sum_k V_k (1 - a_k) h_k w_k}{\sum_k V_k (1 - a_k)}: \qquad \frac{w\,(V_1 h_1 + V_2 h_2)}{V_1 + V_2} \;\longrightarrow\; w\,h_2\]

KCS mô tả cùng hướng đó: self-service tốt lên thì cost per incident ở kênh có người tăng [13]. Vì cost per ticket là chi phí trung bình, con số đó tăng sau triển khai không chứng tỏ thất bại; thứ hai bên cần so là tổng chi phí trên tenant hoặc endpoint.

Chia thặng dư giữa nhà cung cấp và khách

Chia thặng dư theo ba loại hợp đồng Hợp đồng dời điểm chia; và nối đuôi nhau luôn dừng ở Nhà cung cấp gánh rủi ro Thặng dư không phụ thuộc hợp đồng Khách hàng gánh rủi ro , , là chuyển giao: cộng ở phía này, trừ ở phía kia Theo giờ hoặc ticket T&M, per ticket đi từ nhà cung cấp sang khách âm khi tự động hoá phạt nhà cung cấp Giá cố định theo tenant hoặc endpoint giá không đổi tới kỳ gia hạn ở lại nhà cung cấp sau gia hạn Theo kết quả outcome-based, giá gắn SLA thoả thuận trên giá kết quả đi qua chia theo và giá outcome tuỳ định nghĩa outcome , hợp đồng giới hạn trách nhiệm trong dải , nhà cung cấp có lãi trong khi âm; phần âm rơi vào khách
Hình 5. Ở cả ba loại hợp đồng, hai phần nối đuôi nhau luôn dừng ở \(S\); hợp đồng chỉ dời điểm chia.

Việc chia cần thêm \(\pi\), phần tiết kiệm dương nhà cung cấp trả lại khách qua giá; \(\theta\), phần rủi ro nhà cung cấp gánh; và loại hợp đồng. Thặng dư của cả hệ là

\[S = \Delta C + \Delta Q - R - C_{\text{switch}}\]

với \(\Delta Q\) chỉ gồm tổn thất thật tránh được, như downtime, và \(C_{\text{switch}}\) là chi phí chuyển đổi khách tự chịu. Hai phần chia:

\[\Delta\Pi_P = \Delta C - \pi\,\Delta C^+ - \Delta R_{\text{cannib}} + \Delta P_{\text{premium}} - \theta R\]

\[\Delta V_C = \pi\,\Delta C^+ + \Delta R_{\text{cannib}} - \Delta P_{\text{premium}} + \Delta Q - C_{\text{switch}} - (1 - \theta) R\]

với \(\Delta C^+=\max(\Delta C,0)\), \(\Delta R_{\text{cannib}}\) là doanh thu nhà cung cấp mất khi hợp đồng tính theo giờ hay theo ticket, \(\Delta P_{\text{premium}}\) là phần giá cộng thêm cho dịch vụ có agent. Cộng lại:

\[\Delta\Pi_P + \Delta V_C = S\]

Đồng nhất thức này đúng với mọi \(\pi\), \(\theta\), \(\Delta R_{\text{cannib}}\), \(\Delta P_{\text{premium}}\). Ba khoản \(\pi\,\Delta C^+\), \(\Delta R_{\text{cannib}}\), \(\Delta P_{\text{premium}}\) là chuyển giao, có mặt ở hai phía với dấu ngược nên triệt tiêu: đồng doanh thu nhà cung cấp mất vì khách được tính ít giờ hơn là đồng khách giữ lại, và SLA credit cũng vậy. Chỉ \(R\) và \(C_{\text{switch}}\) là nguồn lực tiêu thật. Cách chia ngây thơ trừ chuyển giao như chi phí thật; khối Đào sâu thứ hai chỉ ra nó lệch khỏi \(S\) ở đâu.

Dấu của \(\Delta\Pi_P\) đổi theo hợp đồng. Dưới T&M hoặc giá theo ticket, \(\Delta R_{\text{cannib}}=p_h \Delta H\) với \(p_h\) là giá bán một giờ, \(\pi\approx 0\), và với \(\Delta P_{\text{premium}}=0\):

\[\Delta\Pi_P = (\rho_{\text{real}}\,\bar w - p_h)\,\Delta H - C_{\text{agent}} - \theta R\]

Vế phải âm mỗi khi \(p_h>\rho_{\text{real}}\,\bar w\), tức với gần như mọi hợp đồng T&M có biên dương: T&M phạt nhà cung cấp khi tự động hoá, khách nhận trọn \(p_h \Delta H\) dưới dạng ít giờ hơn trên hoá đơn. FAR 16.601, quy định mua sắm của Chính phủ Mỹ (bản hiệu lực 13/3/2026), viết rằng hợp đồng time-and-materials không tạo động cơ lợi nhuận nào cho nhà thầu để kiểm soát chi phí hay hiệu suất lao động [14]; áp nguyên lý đó sang MSP là suy luận.

Dưới giá cố định theo tenant hoặc endpoint, \(\Delta R_{\text{cannib}}=0\) và \(\pi\approx 0\) tới kỳ gia hạn, nên \(\Delta\Pi_P=\Delta C-\theta R\) và \(S\) nằm ở nhà cung cấp, khớp với FAR 16.202-1: nhà thầu firm-fixed-price chịu toàn bộ lời lỗ [15]. Đây là loại phổ biến ở MSP: trong khảo sát 2023 của Kaseya, hãng bán phần mềm cho MSP, per-user cộng per-device chiếm 26 phần trăm, tính theo sự cố chỉ 3 phần trăm [16]. Khách lấy lại một phần qua \(\pi>0\) ở kỳ gia hạn nếu đàm phán được, và phần lớn chưa làm được: trong khảo sát Global Outsourcing 2024 của Deloitte, hãng cũng bán operate services, chỉ khoảng 25 phần trăm bên mua thấy chi phí vendor giảm nhờ AI [17]. Khách chỉ nhận phần tiết kiệm khi hợp đồng ghi \(\pi\). Một thảo luận cộng đồng trên Hacker News ngày 2025-10-07 nêu chiều ngược lại: khách sẽ đòi trả ít hơn nhiều cho việc làm bằng GenAI [18].

Dưới hợp đồng theo kết quả, \(\pi\) thoả thuận trên \(\Delta C^+\) và giá của kết quả đi qua \(\Delta P_{\text{premium}}\); FAR 37.601 đòi hợp đồng performance-based có tiêu chuẩn đo được [19]. Suy luận: bên viết định nghĩa outcome quyết định bên nào chịu rủi ro đo lường, như trang billing của Intercom tính cả assumed resolution, khách rời hội thoại mà không hỏi thêm, là outcome có thu tiền [20] (đọc ngày 2026-09-25).

Mặc định \(\theta=1\): agent là công cụ nhà cung cấp chạy, nên \(s^*\) tính cho một item vừa là ngưỡng của nhà cung cấp vừa là ngưỡng của cả hệ. Khi hợp đồng giới hạn trách nhiệm, \(\theta<1\); với \(\rho_{\text{real}}=1\) và \(\pi=0\):

\[s^*_P(\theta) = \frac{\rho_r + \rho_e + \rho_c + \theta\rho_D}{1 + \rho_e} < s^*\]

Trong dải \(s^*_P(\theta) \lt s \lt s^*\), nhà cung cấp có lãi trong khi \(S\) âm, phần âm rơi vào khách. Suy luận: điều khoản giới hạn trách nhiệm tạo động cơ tự động hoá quá tay, và người mua đọc được độ rộng của dải đó từ \(\theta\). Với \(\theta=1\), \(\pi=0\), \(\rho_{\text{real}}=1\) và không có cannibalization, phần của nhà cung cấp trên item loại \(k\) đúng bằng \(v\) tính cho một item.

Widget tính từ giá trị ròng tới phần chia cho một item, mọi kết quả chia cho \(hw\), giả định giá cố định theo item, \(\theta=1\), không cannibalization, \(\Delta Q=0\) và \(C_{\text{switch}}=0\). Tám thanh trượt là \(a\), \(s\), bốn tỉ lệ \(\rho\), \(\pi\) và \(\rho_{\text{real}}\). Ngoài giá trị ròng, phần nhà cung cấp giữ và phần khách nhận, widget hiện ba ngưỡng: \(s^*\), \(s^*_{\text{real}}\), và ngưỡng của nhà cung cấp sau khi trả khách phần \(\pi\):

\[s^*_P = \frac{\rho_r + \rho_e + \big(\rho_c + \rho_D/(1 - \pi)\big)/\rho_{\text{real}}}{1 + \rho_e}\]

Có những bộ tham số mà giờ người vẫn giảm trong khi thặng dư đã âm, vì phần giờ giảm, kể cả khi thành tiền trọn vẹn, nhỏ hơn chi phí chạy agent.

Ngưỡng hoà vốn của một việc giao cho agent

Tham số do người đọc tự đặt, không phải số đo của công ty nào. Mặc định nằm giữa mỗi khoảng. là giờ làm tay một việc, là chi phí một giờ người, nên là chi phí làm tay một việc. Mọi kết quả tính cho một việc và chia cho .

, ngưỡng hoà vốn
, giá trị ròng mỗi việc
Nhà cung cấp giữ
Khách nhận

Nếu chỉ phần giờ đổi được thành tiền mới tính, ngưỡng lên thành = . Để nhà cung cấp có lãi sau khi trả khách phần , cần vượt = .

theo phần nhà cung cấp giữ hiện tại, xanh khi lời, đỏ khi lỗ

Giả định của hình: giá cố định theo việc, nhà cung cấp gánh trọn rủi ro (), không tính chất lượng tăng thêm hay chi phí chuyển đổi. Tổng hai ô cuối là thặng dư tiền thật sau rủi ro.

Kéo \(a\) chỉ đổi độ dốc, ba ngưỡng đứng yên; câu hỏi cho mỗi lớp việc là \(s\) đứng bên nào của từng ngưỡng.

NPV, ROI và payback theo kỳ

Tính theo thời gian cần thêm chỉ số kỳ \(t\) và độ phủ \(a_k(t)\). Forrester Consulting bán một khung tính ROI tên Total Economic Impact; theo trang phương pháp của Forrester, mọi nghiên cứu theo khung này đều ghi là commissioned [21]. Viết bằng ký hiệu, với \(r\) trong các công thức NPV là tỉ lệ chiết khấu và \(h_b\), \(h_c\) là hệ số rủi ro do người lập nghiên cứu chọn:

\[\tilde B_t = B_t (1 - h_b), \qquad \tilde C_t = C_t (1 + h_c)\]

\[\text{NPV} = \sum_{t=0}^{T} \frac{\tilde B_t - \tilde C_t}{(1 + r)^t}, \qquad \text{ROI} = \frac{\text{NPV}}{\text{PV}(\tilde C)}\]

\[T^* = \min\Big\{T : \sum_{t \le T} (\tilde B_t - \tilde C_t) \ge 0\Big\}\]

Lắp \(\Delta\Pi_P\) theo kỳ vào \(B_t-C_t\) thì ra \(\text{ROI}_P\), lắp \(\Delta V_C\) thì ra \(\text{ROI}_C\). OMB Circular A-94 (văn bản 1992 của Chính phủ Mỹ) coi NPV là tiêu chuẩn, chỉ tính phần gia tăng, và bắt buộc phân tích độ nhạy [22].

Hình 6 và hình 7 vẽ hình dạng hàm với tham số không đơn vị do người viết chọn; độ dốc \(\beta=1\) ở hình 7 cũng không lấy từ số đo nào.

Hình 6. Đầu tư vô hình dồn đầu kỳ khi độ phủ còn thấp làm tổng cộng dồn đi xuống trước khi đi lên; đo ROI sớm và muộn cho hai kết quả khác nhau.

Gọi \(n_t=\tilde B_t-\tilde C_t\). Nếu \(n_t\) âm ở các kỳ đầu rồi không âm từ một kỳ \(t_0\), tổng cộng dồn giảm tới kỳ \(t_0-1\) rồi tăng. Item loại \(k\) giờ lặp qua từng kỳ: khi \(a_k(t)\) còn nhỏ, \(v_k\) gần 0 trong khi chi phí vô hình (tri thức, runbook, eval) đã trả, và \(a_k(t)\) chỉ tăng mỗi khi lớp \(k\) qua một cổng lên bậc, cơ chế sinh đường logistic trong hình 6. Brynjolfsson, Rock và Syverson gọi hiện tượng này ở cấp vĩ mô là Productivity J-Curve: công nghệ đa dụng như AI cần đầu tư bổ trợ vô hình, nên năng suất bị đo thấp lúc đầu và cao về sau [23] (1/2021); nối nó sang knowledge base và eval là suy luận.

Payback có chiết khấu không sớm hơn \(T^*\) khi \(n_t\) đổi dấu một lần. Trong 392 CFO Graham và Harvey khảo sát, 56,7 phần trăm luôn hoặc gần như luôn dùng payback, và doanh nghiệp nhỏ dùng nó gần ngang NPV [24] (2001). Suy luận: đáy J phạt MSP nhỏ nặng nhất; với khách, \(T^*\) đến muộn hơn nếu \(\pi\) chỉ dương từ kỳ gia hạn.

Ba TEI do vendor đặt hàng đọc được công khai trong mảng này là của Moveworks (4/2023) [25], ScienceLogic (9/2023) [26] và PagerDuty (blog 3/10/2024) [27]. Ở hai bản đọc được tới từng bảng, vendor cung cấp tên khách được phỏng vấn, 5 người ở bản Moveworks và 4 người ở bản ScienceLogic, còn tổ chức trong mô hình là một composite ghép từ các interviewee, không phải công ty có thật. Hệ số rủi ro là một điểm cho mỗi dòng, không có phân tích độ nhạy. Lợi ích là giờ nhân lương, và không bản nào trong hai bản áp hệ số thu hồi cho giờ của nhân viên IT, tức cả hai ngầm đặt \(\rho_{\text{real}}=1\). Người viết tự kiểm còn thấy lỗi nội tại: bảng dòng tiền trang 28 của bản Moveworks không khớp số chính của báo cáo, bản ScienceLogic còn sót placeholder của template. Vendor trả tiền và chọn người được phỏng vấn, nên các con số đó không phải số đo độc lập dù mang tên Forrester; phần disclosure cũng khuyên người đọc tự ước lượng.

TEI ScienceLogic do vendor đặt hàng, với composite là một MSP toàn cầu không có thật và cả sáu dòng lợi ích là giờ nhân lương, báo PV lợi ích 5.841.467 USD, PV chi phí 2.269.482 USD và ROI 157 phần trăm, chiết khấu 10 phần trăm trong ba năm [26] (9/2023). Đặt \(\rho_{\text{real}}=0{,}5\):

\[\text{ROI}\big|_{\rho_{\text{real}} = 0{,}5} = \frac{0{,}5 \times 5.841.467 - 2.269.482}{2.269.482} = \frac{651.251{,}5}{2.269.482} \approx 0{,}287\]

Mọi giả định khác giữ nguyên, nên ROI của composite trong TEI do vendor đặt hàng đó còn khoảng 29 phần trăm. Đây là phép thử độ nhạy mà A-94 đòi, không phải ước lượng ROI của MSP nào.

Các bậc tự chủ và cổng lên bậc

Đo độ dài việc bằng \(x=h/h_{50}\), với \(h_{50}\) là độ dài mà agent làm đúng một nửa số lần. Giờ review và chi phí chạy gần như cố định mỗi item nên \(\rho_r=r_0/x\), \(\rho_c=c_0/x\); giờ phạt và thiệt hại tỉ lệ cỡ việc nên \(\rho_e\), \(\rho_D\) là hằng số:

\[s(h) = \frac{1}{1 + (h/h_{50})^{\beta}}, \qquad s^*(h) = \frac{(r_0 + c_0)/x + \rho_e + \rho_D}{1 + \rho_e}\]

Hình 7. Chi phí cố định mỗi việc cộng xác suất đúng giảm theo độ dài làm vùng có lãi thành một dải bị chặn cả hai đầu.

Khi \(x\to 0\), \(s^*(h)\to \infty\): chi phí cố định ăn hết giờ tiết kiệm. Khi \(x\to \infty\), \(s^*(h)\) hạ về sàn \((\rho_e+\rho_D)/(1+\rho_e)\) trong khi \(s(h)\to 0\). Dạng logistic theo log độ dài lấy từ METR, nơi horizon 80 phần trăm ngắn hơn horizon 50 phần trăm từ 4 tới 6 lần [6] (arXiv, 2025-03-18). Suy luận: vận hành cần mức thành công cao hơn hẳn 50 phần trăm, nên dải có lãi nằm ở việc ngắn hơn nhiều so với horizon người ta hay trích. Ba thay đổi đều nới dải: model tốt hơn nâng \(s(h)\) ở mọi độ dài, review rẻ hơn hạ \(s^*(h)\) ở mọi độ dài, giờ phạt và rủi ro nhỏ hơn cũng hạ \(s^*(h)\) ở mọi chỗ \(s^*<1\) vì

\[\frac{\partial s^*}{\partial \rho_e} = \frac{1 - s^*}{1 + \rho_e}, \qquad \frac{\partial s^*}{\partial \rho_D} = \frac{1}{1 + \rho_e}\]

Với agent tự chủ trên việc vận hành mở, ITBench bản ICML 2025 đo GPT-4o trên 42 kịch bản SRE: pass@1 khắc phục 11,4 phần trăm, 0 phần trăm ở mức Hard [28]. OpenRCA (ICLR 2025) đo Claude 3.5 Sonnet trên 335 sự cố: đúng hoàn toàn 11,34 phần trăm, và 0 phần trăm khi phải đúng đủ ba phần tử root cause [29]. Ở bậc gợi ý, triage cho số cao hơn nhiều: COMET chạy online ở Microsoft đạt ACC@1 0,61 [30] (ISSRE 2024); RCACopilot đạt Micro-F1 0,766 nhưng Macro-F1 0,533 [31] (EuroSys 2024). Suy luận: RCA đầy đủ ở bậc tự chủ nằm dưới mọi ngưỡng hợp lý, triage là ứng viên đầu tiên cho bậc thấp, và \(s\) phải đo theo từng lớp vì nhóm hiếm kém hẳn nhóm phổ biến.

Thang tự chủ và cổng lên bậc Mỗi bậc đổi , , nên có riêng; chỉ lên bậc khi qua cổng Cổng lên bậc cận dưới Wilson của , đo ở shadow, phải vượt của bậc mới lần sạch: , nên cần 0 lỗi trong lần: tỉ lệ lỗi vẫn có thể tới L0 thủ công L1 gợi ý L2 người duyệt trước khi chạy L3 chạy rồi review lấy mẫu L4 tự chủ trong guardrail cổng cổng cổng cổng giờ review phần giao agent rủi ro giảm tăng tăng
Hình 8. Mỗi bậc đổi cùng lúc giờ review, phần giao cho agent và rủi ro, nên mỗi bậc có ngưỡng riêng.

Thang có năm bậc: L0 thủ công; L1 agent gợi ý; L2 người duyệt trước khi agent chạy; L3 agent chạy rồi người review lấy mẫu; L4 agent tự chủ trong guardrail. Parasuraman, Sheridan và Wickens (2000) đặt tự động hoá trên thang 10 mức, trong đó mức 6 cho người một khoảng thời gian có hạn để phủ quyết trước khi máy tự thực thi [32]; đặt L0 tới L4 lên thang đó là suy luận. Lên bậc thì \(r\) giảm, \(a\) tăng, \(qD\) tăng, như khi item loại \(k\) đi từ L1 lên L2 và agent bắt đầu tự chạy lệnh; vì \(a\) không dời ngưỡng, \(r\) và \(qD\) của bậc mới quyết định \(s^*\) của bậc đó, còn \(\theta\) quyết định ai gánh phần \(qD\) tăng thêm.

Cổng lên bậc: lớp \(k\) đi từ bậc L lên L+1 khi cận dưới Wilson của \(s_k\), đo ở chế độ shadow của bậc L+1, vượt \(s_k^*\) của bậc L+1. Cổng dùng cận dưới chứ không dùng tỉ lệ quan sát, vì cùng một tỉ lệ bằng 1 cho độ chắc rất khác nhau tuỳ số lần chạy. Khi mọi lần chạy đều sạch:

\[L_W(n, n) = \frac{n}{n + z^2}, \qquad n > \frac{z^2\, s^*}{1 - s^*}\]

Wilson và rule of three coi các lần thử là độc lập, nên phải đếm theo sự cố khác nhau: mọi ticket từ cùng một cơn bão alert với cùng root cause chỉ tính là một lần thử. Với \(z=1{,}96\), cận dưới của khoảng hai phía 95 phần trăm [33], số lần chạy sạch tối thiểu là:

\(s^*\) của bậc mới số lần chạy sạch tối thiểu cận dưới Wilson tại số lần đó
0,80 16 0,806
0,90 35 0,901
0,95 73 0,950

Với 10 lần sạch trên 10, lớp việc chưa qua được cổng của \(s^*=0{,}8\). Với 0 lỗi trong \(n\) lần, cận trên một phía 95 phần trăm của tỉ lệ lỗi xấp xỉ \(\tfrac{3}{n}\), tức rule of three [34] (JAMA, 1983), nên 100 lần sạch vẫn chưa loại được tỉ lệ lỗi 3 phần trăm.

\(s\) dùng cho cổng phải đo theo \(\text{pass}^k\) trên lớp hẹp, không lấy pass@1 rồi luỹ thừa. τ-bench định nghĩa \(\text{pass}^k\) là xác suất cả \(k\) lần thử đều thành công; ở miền retail, gpt-4o có \(\text{pass}^1\) bằng 61,2 phần trăm và \(\text{pass}^8\) khoảng 25 phần trăm, trong khi 0,612 luỹ thừa 8 xấp xỉ 0,02 [35] (arXiv, 2024-06-17). Công thức \(s^n\) chỉ đúng khi các lần độc lập và cùng xác suất; độ khó không đều trong lớp dồn thành công vào task dễ. ITBench bản arXiv v1 cho thấy cùng tính chất: GPT-4o chẩn đoán đúng 6 trên 10 lần ở một kịch bản, 1 trên 10 ở kịch bản khác [36] (2025-02-07). Con số 13,8 phần trăm trong abstract bản v1 là pass@1 chẩn đoán, không phải tỉ lệ xử lý xong; tỉ lệ khắc phục là 11,4 phần trăm. Bỏ trace thì khắc phục rơi xuống 2,86 phần trăm [36], nên \(s\) là thuộc tính của cặp agent và môi trường khách (suy luận). Luật cho lớp \(k\): tách lớp tới khi \(s\) trong lớp gần đồng nhất, rồi đo \(\text{pass}^k\) trên item trọn vẹn.

Chốt \(n\) trước khi đo, vì kiểm mỗi ngày rồi lên bậc ở lần đầu vượt ngưỡng làm xác suất lên nhầm cao hơn mức danh nghĩa; đổi model, prompt, runbook hay môi trường khách thì đếm lại. Shadow không thực thi nên bậc mới cần một pha canary với \(a\) nhỏ. Hạ bậc bằng cùng công cụ theo chiều ngược, khi cận dưới của tỉ lệ lỗi vượt phần bù của \(s^*\).

Vế chi phí của mọi bậc cao có hai khoản benchmark không đo. Bainbridge (1983) chỉ ra kỹ năng mai một khi người chỉ còn giám sát, nên đúng lúc phải tiếp quản thì người đó thiếu kinh nghiệm [37]. Dell'Acqua và cộng sự đo trên 758 tư vấn viên: với việc ngoài biên khả năng của AI, nhóm dùng AI đúng ít hơn nhóm đối chứng 19 điểm phần trăm [38] (Organization Science, 2026). Suy luận: đào tạo và giám sát thuộc \(r\) và \(C_t\), kết luận sai trông như đúng thuộc \(e\); nhà cung cấp gánh chúng trong giá vốn, khách gánh chúng qua chất lượng.

Đào sâu: Dẫn xuất ngưỡng hoà vốn

nhánh xác suất giờ người tiền ngoài lương
làm tay \((1-a)\) \(h\) 0
đúng, không hại \(as(1-q)\) \(r\) \(c\)
đúng, gây hại \(asq\) \(r\) \(c+D\)
sai, không hại \(a(1-s)(1-q)\) \(r+h+e\) \(c\)
sai, gây hại \(a(1-s)q\) \(r+h+e\) \(c+D\)

Năm xác suất cộng lại bằng 1. Hai lá đúng góp \(asr\) giờ, hai lá sai góp \(a(1-s)(r+h+e)\), nhánh tay góp \((1-a)h\); gom \(r\) được \(E[H]\). Chi phí kỳ vọng là \(w\,E[H]+a(c+qD)\), và hiệu với mốc làm tay:

\[h - E[H] = a\,\big[h - r - (1 - s)(h + e)\big] = a\,\big[s h - r - (1 - s) e\big]\]

\[v = w\,(h - E[H]) - a(c + qD) = a\,\big[w\,(s h - r - (1 - s) e) - c - q D\big]\]

Khai triển \(wsh-wr-we+wse=c+qD\) rồi gom \(s\) được \(s^*\). Chia cho \(h\) và \(hw\) rồi thay \(s^*\) vào:

\[\frac{v}{h w} = a\,\big[s - \rho_r - (1 - s)\rho_e - \rho_c - \rho_D\big] = a\,(1 + \rho_e)\,(s - s^*)\]

Nếu thiệt hại chỉ xảy ra sau một lần chạy sai, \(q=(1-s)\,q_f\), thì \(v\) vẫn tuyến tính theo \(s\) và

\[s^* = \frac{r + e + (c + q_f D)/w}{h + e + q_f D / w}\]

Đào sâu: Chuyển giao giữa hai phía

Cách chia ngây thơ viết \(S=\Delta C+\Delta Q-R\), \(\Delta\Pi_P=(1-\pi)\Delta C-\Delta R_{\text{cannib}}\) và \(\Delta V_C=\pi\Delta C+\Delta Q-\Delta P_{\text{premium}}-C_{\text{switch}}\). Cộng hai phần:

\[\Delta\Pi_P + \Delta V_C = \Delta C + \Delta Q - \Delta R_{\text{cannib}} - \Delta P_{\text{premium}} - C_{\text{switch}}\]

So với \(S\) nó tự đặt ra, hai vế lệch bốn khoản. \(R\) không nằm trong phần của phía nào, còn \(\Delta R_{\text{cannib}}\), \(\Delta P_{\text{premium}}\), \(C_{\text{switch}}\) bị trừ như thể biến mất khỏi nền kinh tế:

\[\big(\Delta\Pi_P + \Delta V_C\big)_{\text{naive}} + \Delta R_{\text{cannib}} + \Delta P_{\text{premium}} + C_{\text{switch}} = S_{\text{naive}} + R\]

Công thức ở phần chia thặng dư khác ba chỗ. Chuyển giao có mặt ở cả hai phía với dấu ngược: cách chia ngây thơ thiếu \(+\Delta R_{\text{cannib}}\) ở phía khách và \(+\Delta P_{\text{premium}}\) ở phía nhà cung cấp, còn \(R\) và \(C_{\text{switch}}\) là tiêu thật nên vào \(S\). Rủi ro có chủ: \(\theta R\) cho nhà cung cấp, \((1-\theta)R\) cho khách. \(\pi\) chỉ áp lên \(\Delta C^+\), vì dạng \(\pi\Delta C\) bắt khách chia lỗ qua giá khi \(\Delta C<0\). Với công thức đó, tổng không còn phụ thuộc biến chuyển giao nào:

\[\frac{\partial(\Delta\Pi_P + \Delta V_C)}{\partial x} = 0, \qquad x \in \{\pi,\ \theta,\ \Delta R_{\text{cannib}},\ \Delta P_{\text{premium}}\}\]

Đào sâu: Payback có chiết khấu

Gọi \(K_T\) là tổng cộng dồn tới kỳ \(T\):

\[K_T = \sum_{t \le T} n_t, \qquad K_T - K_{T-1} = n_T\]

Nếu \(n_t\) âm ở các kỳ đầu và không âm từ kỳ \(t_0\), \(K\) giảm tới kỳ \(t_0-1\), đáy chữ J, rồi tăng. Hình 6 dựng dòng tiền như sau, với \(k\) ở khối này là độ dốc logistic và \(\tau\) là hằng số tắt dần:

\[a(t) = \frac{a_{\max}}{1 + e^{-k(t - t_{50})}}, \qquad B_t = b\,a(t)\]

\[C_t = c_{\text{run}}\,a(t) + c_{\text{int}}\,e^{-(t - 1)/\tau} \quad (t \ge 1)\]

Số hạng thứ hai của \(C_t\) là đầu tư vô hình dồn đầu kỳ. Để chứng minh payback có chiết khấu không sớm hơn \(T^*\), gọi \(d_t=(1+r)^{-t}\), giảm theo \(t\). Với \(t \lt t_0\), \(n_t \lt 0\) và \(d_t\ge d_{t_0}\); với \(t\ge t_0\), \(n_t\ge 0\) và \(d_t\le d_{t_0}\). Cả hai trường hợp cho \(n_t d_t\le n_t d_{t_0}\), nên

\[\sum_{t \le T} n_t\, d_t \;\le\; d_{t_0} K_T\]

và tổng có chiết khấu không âm kéo theo \(K_T\ge 0\). Với lợi ích đều \(b\) mỗi kỳ sau khoản \(C_0\), \(T^*=\lceil C_0/b \rceil\).

Đào sâu: Khoảng Wilson và rule of three

Khoảng Wilson cho \(x\) lần đúng trong \(n\) lần chạy shadow, \(\hat p=x/n\):

\[\frac{\hat p + \dfrac{z^2}{2n} \pm z\sqrt{\dfrac{\hat p(1 - \hat p)}{n} + \dfrac{z^2}{4n^2}}}{1 + \dfrac{z^2}{n}}\]

Khi \(x=n\), căn còn \(z/(2n)\), tử số của cận dưới còn 1, cận dưới thành \(n/(n+z^2)\); giải bất đẳng thức với \(s^*\) ra bảng ở phần thang tự chủ. Khoảng Wald cho cận dưới bằng 1 bất kể \(n\) khi \(\hat p=1\), vô nghĩa đúng ở vùng cổng quan tâm; Brown, Cai và DasGupta (2001) khuyên dùng Wilson hoặc Jeffreys khi \(n\) nhỏ [39]. Rule of three giải \((1-p)^n=0{,}05\) cho cận trên của tỉ lệ lỗi khi không có lỗi nào:

\[p = 1 - 0{,}05^{1/n} \approx \frac{-\ln 0{,}05}{n} \approx \frac{2{,}996}{n} \approx \frac{3}{n}\]

Sai số của \(\tfrac{3}{n}\) dưới một phần nghìn với mọi \(n\) từ 69 tới 10000.

Lớp việc có \(D\) lớn, như thay đổi cấu hình production hay bảo mật, cần cổng bảo thủ hơn: Clopper-Pearson dựng khoảng bằng cách đảo phép kiểm định nhị thức [40], và khi mọi lần đều sạch

\[\text{LB}_{\text{CP}}(n, n) = \alpha^{1/n}, \qquad n \ge \frac{\ln \alpha}{\ln s^*}\]

Ở cùng mức một phía, cận này thấp hơn cận Wilson khi mọi lần đều sạch, nên cổng dựng trên nó đòi nhiều lần sạch hơn.

Đích đến và cây chỉ số

Đích đến là trạng thái mỗi lớp \(k\) đứng ở bậc cao nhất mà nó đã qua cổng, và đứng yên ở đó tới khi số đo đổi. Tỉ lệ tự động hoá chung không đo được trạng thái này, vì lớp RCA đầy đủ dừng ở L1 khi chưa qua cổng L2 vẫn đúng với định nghĩa trên.

Cây chỉ số của nhà cung cấp và khách Mỗi chỉ số trỏ về một biến; hai north star đo hai phần của cùng một north star north star Nhà cung cấp biên đóng góp mỗi tenant , engineer leverage Khách hàng tổng chi phí vận hành + chi phí downtime leading đi trước north star guardrail không được xấu đi không dùng đo sai biến verified automation rate agent đóng; trong ngày không reopen, không liên hệ lặp, không escalate giờ review mỗi item escalation rate SLA attainment change failure rate, thời gian phục hồi (DORA) sự cố do hành động của agent deflection không kiểm chứng đếm thay cho giờ tiết kiệm không đổi P&L đếm thay cho chi phí mỗi ticket trước và sau lệch vì hiệu ứng cơ cấu
Hình 9. Mỗi chỉ số trỏ về đúng một biến của mô hình, còn hai north star đo hai phần của cùng một \(S\).

Chỉ số đi trước north star là verified automation rate:

\[\text{VAR} = \frac{\sum_k V_k\, a_k\, s_k^{\text{ver}}}{\sum_k V_k}\]

với \(s_k^{\text{ver}}\) là tỉ lệ item agent đóng mà trong \(N\) ngày không reopen, không liên hệ lặp, không escalate. VAR đếm cùng \(s^{\text{ver}}\) mà cổng dùng, nên chặt hơn outcome mà Intercom tính tiền, vốn gồm cả assumed resolution lẫn một lượt procedure handoff sang người [20]. Hai chỉ số đi trước còn lại là giờ review mỗi item, trỏ về \(r\), và escalation rate, trỏ về \(a(1-s)\).

Hai north star nằm cạnh nhau: nhà cung cấp theo dõi biên đóng góp mỗi tenant cùng \(\lambda\), trỏ về \(\Delta\Pi_P\); khách theo dõi tổng chi phí vận hành cộng chi phí downtime, trỏ về \(\Delta V_C\). Hai phía đọc chung các chỉ số còn lại, vì chúng đo các biến quyết định kích thước của \(S\).

Guardrail là các số không được xấu đi khi lên bậc. SLA attainment ứng với \(\Delta Q\); change failure rate và thời gian phục hồi ứng với \(q\) và \(D\), và khảo sát DORA 2024 do Google Cloud tài trợ thấy tăng 25 phần trăm mức áp dụng AI đi kèm độ ổn định giao hàng giảm 7,2 phần trăm [41] (2024-10-23, tương quan), gợi ý rằng \(e\) và \(qD\) có thể hiện ra ở hạ nguồn. Sự cố do hành động của agent trỏ về \(R\): AI Incident Database ghi sự cố #1152, ngày 2025-07-18, agent của Replit được cho là đã xoá database production trong lúc code freeze [42], và trong một thảo luận cộng đồng trên Hacker News ngày 2026-04-26 về một vụ agent xoá database cùng backup qua một API token quá quyền, các bình luận hàng đầu quy gốc rễ về phân quyền, không về model [43]. Về cỡ của \(D\): 57 phần trăm người trả lời khảo sát 2025 của Uptime Institute nói outage lớn gần nhất tốn trên 100.000 USD [44] (thông cáo 2026-05-13).

Ba chỉ số hay gặp đo sai biến nên không dùng: deflection không kiểm chứng đếm \(s\) thay cho \(s^{\text{ver}}\); giờ tiết kiệm không đổi P&L đếm \(\Delta H\) thay cho \(\Delta C\); chi phí mỗi ticket so trước và sau lệch vì hiệu ứng cơ cấu. Chỉ số nào không trỏ được về một biến thì cắt khỏi cây. Item loại \(k\) có mặt trong VAR với trọng số \(V_k a_k\), và phần của nó trong north star mỗi phía là phần \(v\) đã chia theo hợp đồng.

Tiền từ một ticket agent đóng chia cho hai phía theo hợp đồng cộng mức tự chủ; một phần có thể âm, còn tổng hai phần luôn là thặng dư:

\[\Delta\Pi_P + \Delta V_C = S\]

Phụ lục: Citations (44)
  1. Service Desk Cost per Ticket. MetricNet. 2017-05-22. MetricNet bán dịch vụ benchmark và tư vấn service desk; bài tự làm, tự công bố, không nêu cỡ mẫu. Năm 2016, lương và phúc lợi agent chiếm 51,4% chi phí service desk toàn cầu, nhân sự gián tiếp 17,1% (Figure 1). Cost per ticket là tổng chi phí vận hành tháng chia số ticket tháng; Bắc Mỹ năm 2016 trung bình 15,56 USD, từ 2,93 tới 49,69 USD.
  2. Service Leadership Q2 Data Report Reveals Slowing Managed Service Revenue Growth Worldwide, but MSP Profitability Remains Strong. ConnectWise. 2024-08-06. Service Leadership là công ty con của ConnectWise, hãng bán phần mềm PSA và RMM cho MSP. Quý 2/2024, biên gộp managed services trung bình 46,2%, adjusted EBITDA của MSP toàn cầu 14,1%, MSP có vốn PE 18,7%, 16% MSP báo lỗ. Thông cáo không nêu cỡ mẫu và không tách phần lao động trong giá vốn.
  3. Metrics Unleashed: Shift-Left. MetricNet. 2020-04-27. Vlog của MetricNet, không nêu phương pháp. Chi phí fully loaded mỗi ticket ở Bắc Mỹ khoảng năm 2019: L1 khoảng 22 USD, L2 desktop khoảng 70 USD, L3 khoảng 100 USD, field khoảng 220 USD, vendor khoảng 600 USD. Số đã làm tròn, và 22 USD của L1 không khớp với số năm 2016 của cùng hãng.
  4. Junjie Chen, Xiaoting He, Qingwei Lin, Yong Xu và cộng sự. An Empirical Investigation of Incident Triage for Online Service Systems. ICSE-SEIP 2019 (IEEE/ACM). 2019-05. Trên 20 hệ thống online service lớn của Microsoft, 4,11% tới 91,58% incident bị gán lại ít nhất một lần; gán lại làm thời gian triage tăng từ 1,09 tới 24,32 lần tuỳ hệ thống. Thời gian triage tính tới lúc incident tới đúng đội, chưa gồm thời gian xử lý. DOI 10.1109/ICSE-SEIP.2019.00020.
  5. Vivek Rau (Betsy Beyer biên tập). Site Reliability Engineering, Chapter 5: Eliminating Toil. Google. 2017. Toil là việc vận hành production có xu hướng thủ công, lặp lại, tự động hoá được, không để lại giá trị lâu dài và tăng tuyến tính theo số dịch vụ; xử lý pager alert là toil. Google đặt mục tiêu toil dưới 50% thời gian mỗi SRE; khảo sát nội bộ hàng quý cho toil trung bình khoảng 33%, từ 0% tới 80%.
  6. Thomas Kwa, Ben West, Joel Becker, Amy Deng và cộng sự. Measuring AI Ability to Complete Long Software Tasks. arXiv (METR). 2025-03-18. Time horizon 50% là độ dài việc, tính bằng thời gian người làm, mà agent làm được với xác suất 50%. Horizon 80% ngắn hơn horizon 50% từ 4 tới 6 lần; horizon 50% của model tiên phong nhân đôi mỗi 207 ngày giai đoạn 2019 tới 2025. Trong thí nghiệm PR ở phụ lục, maintainer chấm một lời giải của model hết trung bình 3,5 phút. Bộ việc là phần mềm và nghiên cứu ML; tiêu đề ghi theo bản v4 (2026-07-10).
  7. Gartner Survey Finds Only 20 Percent of Customer Service Leaders Report AI-Driven Headcount Reduction. Gartner. 2025-12-02. Khảo sát 321 lãnh đạo customer service and support tháng 10/2025: 20% đã giảm nhân sự agent nhờ AI, 55% giữ nguyên nhân sự trong khi phục vụ lượng khách lớn hơn, 42% đang tuyển vai trò mới về AI. Số do lãnh đạo tự báo cáo; báo cáo đầy đủ chỉ dành cho khách hàng Gartner.
  8. Joel Becker, Nate Rush, Elizabeth Barnes, David Rein. Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. arXiv (METR). 2025-07-12. Thử nghiệm ngẫu nhiên có kiểm soát với 16 dev có kinh nghiệm, 246 issue trên repo trưởng thành. Cho phép dùng AI làm thời gian hoàn thành tăng 19%, trong khi dev dự đoán giảm 24% và làm xong vẫn ước đã giảm 20%; chuyên gia kinh tế và chuyên gia ML dự đoán giảm 39% và 38%. Công cụ đầu 2025, chủ yếu Cursor Pro với Claude 3.5 và 3.7 Sonnet.
  9. We are Changing our Developer Productivity Experiment Design. METR. 2026-02-24. METR cập nhật thí nghiệm năm 2025, với khoảng tin cậy của kết quả cũ là +2% tới +39%. Nghiên cứu mới từ tháng 8/2025 với 57 dev, 143 repo, hơn 800 task cho nhóm dev cũ -18% (khoảng -38% tới +9%) và dev mới -4% (khoảng -15% tới +9%); số âm là nhanh hơn. METR tự gọi đây là bằng chứng rất yếu, vì 30% tới 50% dev nói họ không nộp một số task mà họ không muốn làm khi thiếu AI.
  10. Erik Brynjolfsson, Danielle Li, Lindsey Raymond. Generative AI at Work. The Quarterly Journal of Economics 140(2). 2025-02-04. 5.172 nhân viên hỗ trợ khách hàng ở một công ty. Trợ lý hội thoại dựa trên LLM tăng số vấn đề giải quyết mỗi giờ 15% trung bình; người ít kinh nghiệm cải thiện cả tốc độ lẫn chất lượng, người giỏi nhất nhanh hơn chút nhưng chất lượng giảm nhẹ. Người vẫn làm việc, trợ lý chỉ gợi ý. Số theo bản QJE 140(2); bản NBER w31161 ghi 5.179 nhân viên và 14%.
  11. Klarna AI assistant handles two-thirds of customer service chats in its first month. Klarna. 2024-02-27. Thông cáo của Klarna: tháng đầu, trợ lý AI xử lý 2,3 triệu hội thoại, hai phần ba số chat, và Klarna quy đổi thành tương đương 700 nhân viên toàn thời gian; thời gian xử lý dưới 2 phút so với 11 phút. Số tự báo cáo, không nêu phương pháp, công bố trước IPO.
  12. Klarna changes its AI tune and again recruits humans for customer service. CX Dive (Industry Dive). 2025-05-09. Năm 2025 Klarna muốn khách luôn có lựa chọn nói chuyện với người và thí điểm tuyển lại nhân viên làm từ xa theo kiểu Uber; CEO nói với Bloomberg rằng chi phí đã là tiêu chí quá lấn át và kết quả là chất lượng thấp hơn. Bài trích email của phát ngôn viên và phỏng vấn Bloomberg.
  13. KCS v6 Adoption Guide: Self-Service Success. Consortium for Service Innovation. 2026-04-20. Tổ chức support thường chỉ thấy dưới 3% tổng nhu cầu support; khách dùng một kênh self-service tốt nhiều gấp khoảng 10 lần kênh có người. Khi self-service hiệu quả hơn, time to resolution và cost per incident lại tăng; tỉ lệ việc mới so với việc đã biết đo hiệu quả self-service tốt hơn. Số 3% và 10 lần lấy từ dữ liệu thành viên Consortium, không nêu phương pháp hay năm đo.
  14. FAR 16.601 Time-and-materials contracts. Acquisition.gov (Federal Acquisition Regulation). 2026-03-13. Quy định mua sắm của Chính phủ Mỹ, bản FAC 2026-01 hiệu lực 13/3/2026. Hợp đồng time-and-materials trả theo giờ lao động với đơn giá cố định và không tạo động cơ lợi nhuận nào cho nhà thầu để kiểm soát chi phí hay hiệu suất lao động, nên bên mua phải giám sát.
  15. FAR 16.202-1 Firm-fixed-price contracts: Description. Acquisition.gov (Federal Acquisition Regulation). 2026-03-13. Cùng bộ FAR, bản FAC 2026-01. Với hợp đồng firm-fixed-price, giá không điều chỉnh theo chi phí thực của nhà thầu; nhà thầu chịu rủi ro tối đa và toàn bộ trách nhiệm về chi phí cùng lời lỗ, nên có động cơ tối đa để kiểm soát chi phí.
  16. MSP Pricing: A Guide to Managed IT Services Pricing. Kaseya. 2022-04-29. Kaseya bán phần mềm cho MSP. Trang hướng dẫn giá (đăng 29/4/2022, sửa 16/8/2026) dẫn khảo sát 2023 Global MSP Benchmark Survey với 1.091 người trả lời, 83% ở châu Mỹ: per-user cộng per-device 26%, per user 21%, phí cố định value-based 14%, per device 13%, à la carte 12%, tiered 10%, incident response 3%. Bảng không có hạng mục outcome-based.
  17. Global Outsourcing Survey 2024. Multidimensional sourcing: Orchestrating the extended workforce ecosystem. Deloitte. 2024. Khảo sát hơn 500 lãnh đạo bên mua của Deloitte, hãng cũng bán operate services. Giá trị vendor mang lại qua AI: tăng hiệu suất 49%, throughput 45%, giảm chi phí dịch vụ vendor 26%; báo cáo viết chỉ khoảng 25% thấy chi phí vendor giảm, chưa tới một nửa đòi giảm giá vendor theo mức tăng năng suất, 32% có cơ chế gain sharing. Phương pháp chỉ mô tả sơ lược và không tách riêng ITSM.
  18. Deloitte to refund the Australian government after using AI in $440k report. Hacker News. 2025-10-07. Thread Hacker News (464 điểm, 230 bình luận) về bài của The Guardian: Deloitte hoàn tiền cho chính phủ Úc vì một báo cáo dùng AI có lỗi. Một bình luận cho rằng khách sẽ đòi trả ít hơn nhiều cho sản phẩm làm bằng GenAI, và phần giảm giá có thể nuốt hết phần tiết kiệm; bình luận khác quy lỗi về giám sát kém.
  19. FAR 37.601 Performance-based acquisition: General. Acquisition.gov (Federal Acquisition Regulation). 2026-03-13. Cùng bộ FAR, bản FAC 2026-01. Hợp đồng dịch vụ performance-based phải có performance work statement, tiêu chuẩn hiệu năng đo được về chất lượng, thời hạn, số lượng cùng cách đánh giá, và incentive gắn với các tiêu chuẩn đó khi phù hợp.
  20. Fin AI Agent outcomes. Intercom Help Center. 2026-09-24. Trang billing của Intercom: mỗi outcome của Fin tính 0,99 USD, tối đa một outcome mỗi hội thoại. Resolution gồm cả assumed resolution, khi khách rời đi không hỏi thêm; procedure handoff, khi Fin chạy xong một procedure rồi chuyển cho người hoặc workflow, cũng tính tiền. Outcome bị trừ nếu khách quay lại chính hội thoại đó, và không tính tiền khi khách đòi gặp người hoặc procedure lỗi. Trang không nói gì về khách liên hệ lại qua hội thoại mới.
  21. Forrester Methodologies: Total Economic Impact. Forrester. không ghi ngày. Forrester tự mô tả khung TEI: bốn thành phần cost, benefits, flexibility, risk; mọi TEI phải ghi là commissioned; Forrester nói khách không mua được kết luận thuận lợi và Forrester giữ quyền biên tập. Trang không nêu tỷ lệ chiết khấu hay cách chọn hệ số rủi ro; các chi tiết đó nằm ở Appendix A của từng nghiên cứu.
  22. Circular A-94: Guidelines and Discount Rates for Benefit-Cost Analysis of Federal Programs (Transmittal Memo No. 64). Office of Management and Budget. 1992. Hướng dẫn của OMB cho phân tích lợi ích và chi phí của chương trình liên bang Mỹ, văn bản năm 1992. NPV là tiêu chuẩn để quyết định chương trình có hợp lý về kinh tế; chỉ tính lợi ích và chi phí gia tăng, bỏ sunk cost; phân tích độ nhạy là bắt buộc. Tỷ lệ chiết khấu thực 7% trong văn bản dành cho đầu tư công.
  23. Erik Brynjolfsson, Daniel Rock, Chad Syverson. The Productivity J-Curve: How Intangibles Complement General Purpose Technologies. American Economic Journal: Macroeconomics 13(1). 2021-01. Công nghệ đa dụng như AI cần đầu tư bổ trợ vô hình, nên năng suất bị đo thấp hơn thực lúc đầu và cao hơn thực về sau. TFP điều chỉnh cho vốn vô hình gắn với phần mềm và phần cứng máy tính cao hơn số chính thức 15,9% vào cuối 2017. Kết quả ở cấp vĩ mô.
  24. John R. Graham, Campbell R. Harvey. The theory and practice of corporate finance: evidence from the field. Journal of Financial Economics 60(2-3). 2001-05. Khảo sát 392 CFO Mỹ cuối thập niên 1990: tỷ lệ luôn hoặc gần như luôn dùng NPV 74,9%, IRR 75,7%, payback 56,7%, discounted payback 29,45%; doanh nghiệp nhỏ dùng payback gần ngang NPV và IRR.
  25. The Total Economic Impact Of Moveworks. Forrester Consulting (commissioned by Moveworks). 2023-04. Forrester Consulting làm cho Moveworks; vendor cung cấp tên 5 khách được phỏng vấn và được xem bản thảo. ROI 256%, NPV 8,25 triệu USD, PV lợi ích 11,48 triệu, PV chi phí 3,23 triệu, ba năm, chiết khấu 10%, trên một composite không có thật 30.000 nhân viên. Dòng avoided IT support cost bằng ticket tránh được nhân 25 phút nhân 35 USD/giờ, không có hệ số thu hồi cho giờ nhân viên IT. Bảng dòng tiền trang 28 ghi PV lợi ích 48.990.518 USD và PV chi phí 9.405.825 USD, không khớp số chính của báo cáo.
  26. The Total Economic Impact Of ScienceLogic SL1. Forrester Consulting (commissioned by ScienceLogic). 2023-09. Forrester Consulting làm cho ScienceLogic; composite là một MSP toàn cầu không có thật, doanh thu khoảng 5 tỷ USD, 90.000 nhân viên, ghép từ 4 công ty IT services. PV lợi ích 5.841.467 USD (trang 8), PV chi phí 2.269.482 USD (trang 17), NPV 3.571.985 USD, ROI 157%, payback dưới 6 tháng, chiết khấu 10% (trang 20); số trang là số in ở chân trang. Cả sáu dòng lợi ích là giờ nhân lương fully burdened, 80 USD/giờ cho support analyst và 100 USD/giờ cho senior engineer, và không dòng nào có hệ số thu hồi. Hệ số rủi ro chỉ có một điểm, không có phân tích độ nhạy.
  27. Dan Anderson. How PagerDuty Operations Cloud Delivered a 249% Return on Investment by Enhancing Operational Efficiency, Automation, and Resiliency. PagerDuty. 2024-10-03. Blog của PagerDuty về TEI mà PagerDuty đặt Forrester làm: ROI 249%, NPV 4,01 triệu USD, PV lợi ích 5,62 triệu, payback dưới 12 tháng. Một interviewee kể MTTA giảm từ 1 giờ sáu năm trước xuống dưới 5 phút, MTTR từ 3 giờ xuống dưới 30 phút, tức cửa sổ sáu năm cho một mô hình ba năm. Bản đầy đủ nằm sau form đăng ký, nên mô tả composite và công thức từng dòng không kiểm được.
  28. Saurabh Jha, Rohan Arora, Yuji Watanabe, Takumi Yanagawa và cộng sự. ITBench: Evaluating AI Agents across Diverse Real-World IT Automation Tasks. Proceedings of Machine Learning Research 267 (ICML 2025). 2025-07. Bản ICML 2025: 102 kịch bản, abstract ghi SRE 11,4%, CISO 25,2%, FinOps 25,8%. Trên 42 kịch bản SRE, mỗi kịch bản chạy 10 lần, GPT-4o (checkpoint 2024-11-20) có pass@1 khắc phục 11,43% và pass@1 chẩn đoán 13,81% (Table 4). Theo độ khó, khắc phục đạt 21%, 12,27% và 0% ở Easy, Medium, Hard. Môi trường là Kubernetes dựng lại; benchmark và agent mẫu do chính nhóm IBM làm.
  29. OpenRCA: Can Large Language Models Locate the Root Cause of Software Failures?. ICLR 2025. 2025-04. 335 sự cố từ ba hệ thống doanh nghiệp (Telecom, Bank, Market), hơn 68 GB telemetry. Claude 3.5 Sonnet (bản 2024-06-20) với RCA-agent đúng hoàn toàn 11,34% sự cố, GPT-4o 8,96%. Ở những sự cố phải đúng đủ ba phần tử root cause (thời điểm, component, lý do), mọi phương pháp đều đạt 0% (Table 3).
  30. Zexin Wang, Jianhui Li, Minghua Ma, Ze Li và cộng sự. Large Language Models Can Provide Accurate and Interpretable Incident Triage. ISSRE 2024 (Microsoft Research). 2024-10. COMET chạy online hơn sáu tháng ở nhiều dịch vụ cloud của Microsoft: ACC@1 0,61 so với 0,47 của hệ rule-based đang chạy, ACC@5 0,88, time to mitigate giảm 35%. Gợi ý được đăng vào trang sự cố, kỹ sư vẫn quyết. Số so trước và sau trong một tháng, không có nhóm đối chứng ngẫu nhiên.
  31. Yinfang Chen, Huaibing Xie, Minghua Ma, Yu Kang và cộng sự. Automatic Root Cause Analysis via Large Language Models for Cloud Incidents. EuroSys 2024 (bản arXiv 2305.15778 v4). 2024-04. 653 sự cố trong một năm của dịch vụ email Transport của Microsoft. Dự đoán nhóm root cause bằng GPT-4 đạt Micro-F1 0,766 và Macro-F1 0,533, tức nhóm hiếm kém hẳn nhóm phổ biến; 24,96% sự cố (163/653) thuộc nhóm root cause chưa từng gặp. Hệ thống phân loại nhóm nguyên nhân, agent không tự khắc phục.
  32. Raja Parasuraman, Thomas B. Sheridan, Christopher D. Wickens. A model for types and levels of human interaction with automation. IEEE Transactions on Systems, Man, and Cybernetics, Part A 30(3). 2000-05. Chia tự động hoá thành bốn loại chức năng (thu nhận, phân tích, quyết định, thực thi), mỗi loại có mức riêng trên thang 10 mức; ở mức 6, người có một khoảng thời gian có hạn để phủ quyết trước khi máy tự thực thi. Tiêu chí phụ khi chọn mức là độ tin cậy của tự động hoá và chi phí hậu quả khi sai. DOI 10.1109/3468.844354.
  33. Edwin B. Wilson. Probable Inference, the Law of Succession, and Statistical Inference. Journal of the American Statistical Association 22(158). 1927-06. Bài gốc của khoảng Wilson, công thức ghi theo dạng chuẩn. Khi mọi lần đều sạch, cận dưới là n/(n + z²), nên cần n > z² s*/(1 - s*); với z = 1,96, số lần chạy sạch tối thiểu là 16, 35, 73 cho s* bằng 0,8, 0,9, 0,95. Khoảng giả định các lần thử độc lập.
  34. James A. Hanley, Abby Lippman-Hand. If Nothing Goes Wrong, Is Everything All Right? Interpreting Zero Numerators. JAMA 249(13). 1983-04-01. Rule of three: n lần thử không lỗi nào thì cận trên một phía 95% của tỉ lệ lỗi là 1 - 0,05^(1/n), xấp xỉ 3/n. 100 lần sạch vẫn chưa loại được tỉ lệ lỗi 3% (giá trị chính xác 2,95%). Cận hai phía xấp xỉ 3,7/n.
  35. Shunyu Yao, Noah Shinn, Pedram Razavi, Karthik Narasimhan. τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. arXiv. 2024-06-17. pass^k là xác suất cả k lần thử độc lập đều thành công; pass@k chỉ cần ít nhất một lần. Bản v1, Table 2, function calling: gpt-4o có pass^1 61,2% ở retail và 35,2% ở airline; pass^8 ở retail còn khoảng 25%, trong khi 0,612^8 xấp xỉ 0,02. Người dùng trong benchmark là LLM giả lập.
  36. Saurabh Jha, Rohan Arora, Yuji Watanabe, Takumi Yanagawa và cộng sự. ITBench: Evaluating AI Agents across Diverse Real-World IT Automation Tasks (arXiv v1). arXiv. 2025-02-07. Bản arXiv v1 của ITBench. Abstract ghi agent giải được 13,8% kịch bản SRE; đó là pass@1 chẩn đoán của GPT-4o, và bản ICML đổi con số tiêu đề sang 11,4% khắc phục. Trên cùng một kịch bản, GPT-4o chẩn đoán đúng 6/10 lần ở kịch bản 13, 1/10 ở kịch bản 8, 8/10 ở kịch bản 21; tác giả quy cho dao động telemetry. Bỏ trace thì chẩn đoán rơi từ 13,81% xuống 9,52%, khắc phục xuống 2,86%.
  37. Lisanne Bainbridge. Ironies of automation. Automatica 19(6). 1983-11. Kỹ năng thao tác mai một khi không dùng, nên người chỉ giám sát thiếu kinh nghiệm đúng lúc phải tiếp quản; người không duy trì được chú ý quá khoảng nửa giờ vào nguồn tin hiếm khi có sự kiện; hệ tự động thành công nhất có thể cần đầu tư đào tạo người vận hành lớn nhất. Bối cảnh là điều khiển quá trình công nghiệp và buồng lái. DOI 10.1016/0005-1098(83)90046-8.
  38. Fabrizio Dell'Acqua, Edward McFowland, Ethan Mollick, Hila Lifshitz và cộng sự. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science. 2026-03-11. Thí nghiệm ngẫu nhiên đăng ký trước với 758 tư vấn viên BCG. Với việc nằm trong tầm AI làm được, nhóm dùng GPT-4 làm xong nhiều hơn 12,2% việc, nhanh hơn 25,1%, chất lượng cao hơn. Với việc nằm ngoài, nhóm đối chứng đúng khoảng 84,5%, hai nhóm dùng AI đúng 60% và 70,6%. Số theo bản Organization Science 37(2) năm 2026.
  39. Lawrence D. Brown, T. Tony Cai, Anirban DasGupta. Interval Estimation for a Binomial Proportion. Statistical Science 16(2). 2001-05. Độ phủ của khoảng Wald thất thường hơn người ta tưởng; tác giả khuyên dùng Wilson hoặc Jeffreys khi n nhỏ.
  40. C. J. Clopper, E. S. Pearson. The Use of Confidence or Fiducial Limits Illustrated in the Case of the Binomial. Biometrika 26(4). 1934. Khoảng Clopper-Pearson, bảo thủ hơn Wilson, công thức ghi theo dạng chuẩn. Cận dưới một phía viết qua phân vị Beta; khi x = n, cận dưới bằng α^(1/n), nên cần n ≥ ln(α)/ln(s*). Ở mức một phía 95%, đó là 14, 29, 59 lần sạch cho s* bằng 0,8, 0,9, 0,95.
  41. Announcing the 2024 DORA report. Google Cloud Blog. 2024-10-23. Khảo sát DORA do Google Cloud tài trợ và công bố; Google bán sản phẩm AI. Tăng 25% mức áp dụng AI đi kèm chất lượng tài liệu +7,5%, chất lượng code +3,4%, tốc độ review +3,1%, trong khi throughput giao hàng -1,5% và độ ổn định giao hàng -7,2%; 39% ít hoặc không tin code do AI sinh. Số là tương quan từ khảo sát.
  42. Incident 1152: LLM-Driven Replit Agent Reportedly Executed Unauthorized Destructive Commands During Code Freeze, Leading to Loss of Production Data. AI Incident Database. 2025-07-18. Agent của Replit được cho là đã xoá database production trong lúc code freeze dù đã được dặn không thay đổi gì, tạo dữ liệu và kết quả test giả, rồi nói sai rằng không rollback được; mục này tổng hợp 5 báo cáo. Dự án là thử nghiệm, database không có khách thật. Ngày ghi là ngày xảy ra sự cố.
  43. An AI agent deleted our production database. The agent's confession is below. Hacker News. 2026-04-26. Thread Hacker News (860 điểm, 1.032 bình luận ngày 2026-09-25) về bài trên X của một người tự nhận là chủ công ty bị sự cố. Theo các đoạn trích trong bình luận, một coding agent dùng API token hạ tầng quá quyền để xoá volume chứa database production cùng backup nằm chung volume. Các bình luận hàng đầu quy lỗi về token không phân quyền, backup chung chỗ và việc dựa vào prompt để kiểm soát. Câu chuyện gốc chưa được kiểm chứng độc lập.
  44. Uptime Announces Annual Outage Analysis Report 2026. Uptime Institute. 2026-05-13. Theo khảo sát thường niên 2025 của Uptime, 57% người trả lời nói outage lớn gần nhất tốn trên 100.000 USD, và năm thứ hai liên tiếp cứ 5 người thì 1 người báo trên 1 triệu USD. Trong chín năm theo dõi outage công khai, nhà cung cấp IT và data center bên thứ ba chiếm khoảng hai phần ba. Số tự báo cáo, thông cáo không nêu cỡ mẫu và không tách sự cố do agent.