GitHub sẽ hợp nhất Copilot Chat trên github.com, ứng dụng di động và Copilot cloud agent thành một trải nghiệm chung, dự kiến không sớm hơn ngày 28/09/2026. Sau thay đổi, dữ liệu trò chuyện trên github.com sẽ được giữ trong suốt vòng đời tài khoản thay vì 28 ngày; chính sách truy cập và mức đánh giá mã mặc định cũng thay đổi.
Đây là cập nhật cần quản trị viên xem trước vì liên quan đồng thời tới quyền sử dụng, lưu dữ liệu, chi phí và cách Copilot đánh giá mã. Bản tin hôm nay còn có nghiên cứu McKinsey về 20 doanh nghiệp tạo giá trị từ AI, dự báo chi phí AI Agent của Gartner, cùng hai case study định lượng từ Decathlon và Salesforce.
1. Tóm tắt nhanh
- GitHub Copilot: hợp nhất ba trải nghiệm, lưu chat trên github.com lâu hơn và chuyển code review mặc định từ Lite sang Balanced từ 28/09.
- McKinsey: 20 doanh nghiệp thành công với AI tăng EBITDA trung bình 20% và tạo 3 USD EBITDA tăng thêm trên mỗi 1 USD đầu tư một lần.
- Gartner: dự báo chi phí suy luận cho mỗi quy trình AI Agent tăng hơn năm lần tới năm 2028.
- Decathlon: Chronos-2 giảm sai số dự báo 11–15 điểm phần trăm ở kỳ hạn 12 tuần và rút thời gian triển khai sang vùng mới còn 2–3 tháng.
- Salesforce: giữ mức tiết kiệm hạ tầng gấp tám lần, đồng thời phân tán model qua nhiều vùng sẵn sàng để tránh một điểm lỗi duy nhất.
- NVIDIA: TensorRT Model Connect đưa model mở từ Hugging Face vào ứng dụng C++ bằng quy trình hai lệnh.
2. Góc nhìn chiến lược: AI tạo giá trị nhờ năng lực tổ chức, không chỉ nhờ model
McKinsey: 20 doanh nghiệp thành công tập trung vào ít điểm tạo giá trị lớn
Trong bài ngày 28/08, McKinsey cho biết họ xem lộ trình chuyển đổi, kết quả tài chính và phỏng vấn lãnh đạo tại 20 doanh nghiệp đã tạo giá trị kinh tế đáng kể từ AI. Nhóm này cải thiện EBITDA (lợi nhuận trước lãi vay, thuế và khấu hao) trung bình 20% sau ba năm; trung bình mỗi 1 USD đầu tư một lần tạo ra 3 USD EBITDA tăng thêm hằng năm.
Hai phần ba doanh nghiệp chỉ tập trung vào tối đa ba lĩnh vực kinh doanh quan trọng. Họ xây cả hệ thống gồm dữ liệu, quy trình, con người và công nghệ thay vì triển khai nhiều công cụ AI rời rạc. Trung bình, chương trình bắt đầu tạo dòng tiền dương sau một đến hai năm, dù cần ba đến bốn năm để đạt lợi ích đầy đủ.
Hàm ý quản trị: hãy chọn một vài điểm có tác động kinh tế lớn, giao một lãnh đạo kinh doanh chịu trách nhiệm đầu-cuối và tài trợ nền tảng như tài sản dài hạn.
Giới hạn bằng chứng: đây là mẫu 20 doanh nghiệp được McKinsey lựa chọn vì đã thành công, không phải khảo sát đại diện cho toàn thị trường; các con số không bảo đảm doanh nghiệp khác đạt kết quả tương tự.
Đọc nghiên cứu McKinsey ngày 28/08
Gartner: một quy trình AI Agent có thể tốn gấp năm lần tới năm 2028
Gartner dự báo chi phí suy luận (chi phí để model xử lý và tạo kết quả) trên mỗi quy trình AI Agent sẽ tăng hơn năm lần tới năm 2028. Lý do là giá mỗi token có thể giảm, nhưng Agent phải đọc nhiều dữ liệu, suy luận nhiều vòng và gọi nhiều công cụ hơn một chatbot đơn giản.
Hàm ý quản trị: doanh nghiệp cần định tuyến việc đơn giản sang model rẻ, chỉ dùng model mạnh cho bước khó, đồng thời đo chi phí trên một công việc hoàn tất thay vì chỉ theo giá token.
Giới hạn bằng chứng: đây là dự báo của Gartner dựa trên xu hướng chi phí và độ phức tạp, không phải số liệu đã quan sát tới năm 2028.
Đọc dự báo công khai của Gartner
KPMG: AI theo ngành phải bắt đầu từ quy trình và yêu cầu kiểm soát
KPMG cho rằng công cụ AI dùng chung phù hợp với nhiệm vụ riêng lẻ, nhưng các quy trình có giá trị cao trong tài chính, pháp lý hoặc y tế cần dữ liệu đáng tin cậy, quyền truy cập được kế thừa và khả năng truy vết nguồn. Bài viết lấy các giải pháp Gemini Enterprise theo ngành làm ví dụ cho cách đưa ngữ cảnh nghiệp vụ vào AI.
Hàm ý quản trị: trước khi chọn model, hãy xác định quy trình cần thiết kế lại, dữ liệu có thể dùng, quyết định nào cần phê duyệt và kết quả kinh doanh nào phải đo.
Giới hạn bằng chứng: đây là quan điểm tư vấn của KPMG gắn với hợp tác Google Cloud, không phải nghiên cứu định lượng độc lập.
3. Case study AI đã kiểm chứng
Decathlon dự báo nhu cầu hàng chục nghìn sản phẩm bằng Chronos-2
Decathlon dự báo doanh số hằng tuần cho hàng chục nghìn sản phẩm tại nhiều khu vực. Nhóm đánh giá model trên 101 mốc thời gian trong gần hai năm, khoảng 25.000 sản phẩm mỗi mốc và hai kỳ hạn 12 tuần, 52 tuần.
| Khu vực | Kỳ hạn | Sai số trước | Chronos-2 |
|---|---|---|---|
| Đông Nam Á | 12 tuần | 39% | 28% |
| Mỹ Latinh | 12 tuần | 53% | 38% |
| Đông Nam Á | 52 tuần | 44% | 38% |
| Mỹ Latinh | 52 tuần | 55% | 46% |
Hệ thống chạy dự báo hằng tuần trên CPU với chi phí điện toán khoảng 0,03 USD mỗi lần, còn tinh chỉnh model diễn ra sáu tháng một lần. Thời gian triển khai sang khu vực mới giảm từ khoảng sáu tháng xuống 2–3 tháng.
Bài học: benchmark công khai chỉ dùng để chọn danh sách ngắn; Decathlon chỉ quyết định sau khi thử trên dữ liệu thật của mình. Các kết quả do AWS và Decathlon công bố, chưa phải kiểm toán độc lập.
Xem toàn bộ case study Decathlon
Salesforce cân bằng chi phí GPU và khả năng chịu lỗi
Salesforce dùng SageMaker Inference Components để nhiều model chia sẻ GPU, qua đó báo cáo giảm chi phí hạ tầng tám lần. Nhưng cách đặt mặc định có thể gom nhiều bản sao model vào cùng một vùng sẵn sàng, tạo nguy cơ gián đoạn nếu vùng đó gặp sự cố.
Nhóm dùng chiến lược SPREAD để phân tán bản sao. Kết quả công bố cho biết mọi model production của Agentforce đáp ứng yêu cầu hai vùng, không một máy hoặc một vùng đơn lẻ nào có thể làm toàn bộ model ngừng hoạt động.
Bài học: tối ưu chi phí bằng cách chia sẻ GPU phải đi cùng quy tắc phân tán và kiểm tra sau mỗi lần mở rộng hoặc cập nhật. Số liệu chi phí là kết quả do Salesforce và AWS công bố.
4. Cập nhật chính thức từ hãng AI
GitHub Copilot đổi chính sách, lưu dữ liệu chat lâu hơn
| Thay đổi | Mốc dự kiến | Việc cần làm |
|---|---|---|
| Hợp nhất Copilot Chat web, mobile và cloud agent | Không sớm hơn 28/09 | Rà lại chính sách truy cập |
| Chat trên github.com giữ suốt vòng đời tài khoản thay vì 28 ngày | Khi trải nghiệm mới ra mắt | Đánh giá yêu cầu lưu dữ liệu và quyền riêng tư |
| Code review mặc định từ Lite sang Balanced | 28/09 | Chọn Lite rõ ràng nếu muốn giữ mức cũ |
| Thu tiền trước cho ghế Business/Enterprise trả bằng thẻ hoặc PayPal | Khách hàng hiện tại: 01/10 | Rà ghế được cấp và ngân sách AI Credits |
Giá niêm yết Copilot Business và Enterprise không đổi. Tuy nhiên, việc thu trước theo ghế và yêu cầu trả thêm khi vượt mức sử dụng có thể ảnh hưởng dòng tiền và quyền truy cập. Nếu doanh nghiệp tắt trải nghiệm hợp nhất, người dùng sẽ mất Copilot trên github.com và ứng dụng di động sau khi thay đổi có hiệu lực.
Đọc toàn bộ thông báo GitHub Copilot
NVIDIA TensorRT Model Connect triển khai model mở bằng hai bước
TensorRT Model Connect là bộ triển khai tham chiếu mở cho các model được hỗ trợ. Nhà phát triển dùng lệnh Python để tạo một gói triển khai từ model trên Hugging Face, sau đó ứng dụng C++ nạp gói đó mà không cần PyTorch hoặc trình thông dịch Python trong môi trường production.
NVIDIA cho biết thư viện bao phủ hơn 80 họ model, gồm văn bản, thị giác và âm thanh. Mã triển khai có thể xem, sửa và mở rộng; tuy nhiên “hai lệnh” chỉ áp dụng cho model và môi trường được hỗ trợ, không loại bỏ nhu cầu kiểm tra độ chính xác, hiệu năng và giấy phép.
Amazon SageMaker Feature Store thêm API ghi theo lô và liệt kê bản ghi
API BatchWriteRecord ghi tối đa 25 bản ghi vào nhiều nhóm đặc trưng trong một lần gọi, còn ListRecords liệt kê mã bản ghi trong một nhóm. Thay đổi giúp giảm số lệnh mạng và hỗ trợ kiểm kê dữ liệu dùng cho model.
Việc cần làm: nhóm dữ liệu nên kiểm tra giới hạn lô, quyền truy cập, xử lý lỗi từng bản ghi và chi phí trước khi thay quy trình đang chạy.
Đọc hướng dẫn SageMaker Feature Store
5. Hướng dẫn và cảnh báo đáng chú ý
Tín hiệu lỗi công khai có thể bị chuyển thành khai thác chỉ trong vài phút
Simon Willison dẫn báo cáo của Anil Madhavapeddy, giáo sư Cambridge và người duy trì OCaml: khoảng mười phút sau khi bản vá được thảo luận công khai, một website đã nhận các truy vấn thăm dò đúng kiểu lỗ hổng. Người duy trì rclone cũng cho biết số báo cáo bảo mật tăng từ khoảng 20 trong mười năm lên hơn 40 chỉ trong một tháng; khoảng 75% có vấn đề đáng xem xét.
Hàm ý: dự án nguồn mở cần rút ngắn khoảng thời gian giữa việc thảo luận bản vá và phát hành, hạn chế chi tiết công khai trước khi người dùng có thể cập nhật, đồng thời dùng AI để hỗ trợ phân loại nhưng vẫn cần người xác minh.
Giới hạn: đây là quan sát của một số người duy trì, chưa phải nghiên cứu toàn ngành.
Đọc cảnh báo và nguồn gốc được dẫn lại
GLM-5.3 Flash chạy trên phần cứng Trung Quốc: tín hiệu đáng chú ý nhưng chưa thể suy rộng
Martin Alderson phân tích ý nghĩa của việc Z.AI công bố một model chạy trên chip sản xuất trong nước. Bài viết coi đây là tiến bộ về khả năng triển khai, nhưng lưu ý khoảng cách về công nghệ sản xuất chip tiên tiến và hiệu quả suy luận không thể kết luận chỉ từ một lần phát hành.
Cách đọc hợp lý: tách ba câu hỏi: model có chạy được không, chi phí/điện năng ra sao và quy mô sản xuất có đáp ứng nhu cầu hay không. Không nên biến một demo thành kết luận địa chính trị rộng.
6. Doanh nghiệp nên làm gì hôm nay?
- Rà chính sách Copilot trước 28/09: xác định ai được dùng, dữ liệu chat được lưu bao lâu và mức code review mặc định.
- Kiểm kê ghế trước 01/10: thu hồi ghế không dùng và đặt ngân sách AI Credits để tránh chi phí bất ngờ.
- Đo chi phí theo công việc hoàn tất: bao gồm model, công cụ, hạ tầng, giám sát và thời gian con người xử lý lỗi.
- Thử model trên dữ liệu thật: học theo Decathlon, dùng nhiều mốc thời gian và so với hệ thống production hiện tại.
- Thiết kế khả năng chịu lỗi ngay từ đầu: kiểm tra nơi đặt từng bản sao model, không chỉ nhìn endpoint có nhiều vùng.
7. Chú thích thuật ngữ
- AI Agent: hệ thống AI có thể lập kế hoạch, gọi công cụ và thực hiện nhiều bước để đạt mục tiêu.
- Token: đơn vị nhỏ mà model dùng để đọc và tạo văn bản; lượng token ảnh hưởng chi phí.
- Suy luận: quá trình model xử lý dữ liệu đầu vào để tạo kết quả.
- Balanced/Lite: hai mức độ sâu của GitHub Copilot code review; Balanced phân tích kỹ hơn và có thể dùng nhiều tài nguyên hơn.
- Vùng sẵn sàng: khu hạ tầng độc lập trong một vùng đám mây, giúp hệ thống tiếp tục chạy khi một khu gặp lỗi.
- WAPE: tỷ lệ sai số tuyệt đối có trọng số trong dự báo; càng thấp càng tốt.
8. Kết luận
Thay đổi của GitHub Copilot cho thấy AI doanh nghiệp không chỉ là câu chuyện model mạnh hơn. Chính sách dữ liệu, cách tính phí, mức tự động hóa mặc định và khả năng quản trị đang trở thành một phần của sản phẩm. Các tổ chức tạo giá trị tốt nhất là những nơi chọn đúng bài toán, đo bằng kết quả kinh doanh và thiết kế vận hành an toàn ngay từ đầu.