Một hệ thống phục vụ hơn 1 tỷ người mỗi tuần thường gợi đến một đội kỹ thuật rất lớn. Nhưng OpenAI cho biết chỉ hai kỹ sư, cùng Codex và GPT‑5.5, đã viết lại toàn bộ dịch vụ lưu trữ Habitat từ Python sang Rust. Phiên bản mới hiện xử lý 95% lưu lượng thật, hiệu quả CPU cao gấp 6 lần và hiệu quả bộ nhớ cao gấp 15 lần.
Tóm tắt 30 giây
- Hai kỹ sư dùng Codex và GPT‑5.5 viết lại Habitat, dịch vụ lưu trữ hỗ trợ hơn 1 tỷ người dùng ChatGPT mỗi tuần.
- Habitat xử lý hơn 70 triệu yêu cầu mỗi giây và quản lý hơn 500 petabyte dữ liệu.
- Bản Rust mới hiệu quả CPU gấp 6 lần, hiệu quả bộ nhớ gấp 15 lần và đang gánh 95% lưu lượng sản xuất.
- Anthropic công bố các trường hợp Claude bị lạm dụng trong bảy nhóm rủi ro và bổ sung bộ đánh giá năng lực nguy hiểm.
- GitHub Copilot Code Review dùng nhiều Agent, tăng số nhận xét lỗi nghiêm trọng được xử lý 47% trong thử nghiệm và giảm khoảng 8% chi phí.
- AWS đề xuất đo chi phí trên mỗi kết quả đúng thay vì chỉ nhìn giá một triệu token.
1. Góc nhìn chiến lược và quản trị rủi ro
1.1. Anthropic: AI đã trở thành lực lượng kỹ thuật cho cả người dùng xấu
Trong báo cáo tình báo mối đe dọa tháng 9/2026, Anthropic mô tả những hoạt động mà hãng đã phát hiện và chặn từ tháng 12/2025 đến tháng 8/2026. Các vụ việc trải rộng trên bảy nhóm: tấn công mạng, giám sát, thao túng thông tin, lừa đảo, phát triển vũ khí, lạm dụng sinh học và đánh cắp năng lực model.
Điểm cần chú ý với doanh nghiệp là AI không còn chỉ hỗ trợ viết vài đoạn mã. Trong một số vụ, kẻ xấu dùng Claude như lực lượng kỹ thuật chính để xây cả hệ thống. Anthropic cho biết đã khóa các tài khoản liên quan, tăng bộ lọc an toàn và chia sẻ thông tin với đối tác hoặc cơ quan chức năng khi phù hợp.
1.2. Năng lực cao hơn đòi hỏi kiểm soát ngay trên nền tảng
Nhóm Frontier Red Team của Anthropic xây bộ đánh giá cho các nhiệm vụ tình báo chiến thuật và vũ khí thông thường. Kết quả của hãng cho thấy model tiên tiến đã làm được một số nhiệm vụ vốn từng cần chuyên gia hiếm và được đào tạo sâu.
Hàm ý quản trị: doanh nghiệp không nên chỉ dựa vào lời nhắc “hãy hành động an toàn”. Quyền truy cập, dữ liệu, công cụ và hành động nhạy cảm phải bị giới hạn bằng cơ chế kỹ thuật; những quyết định có thể gây hậu quả lớn phải cần con người phê duyệt.
Giới hạn: đây là báo cáo và đánh giá do Anthropic tự thực hiện trên hệ thống của mình. Các vụ việc nổi bật không đại diện cho hành vi thông thường của đa số người dùng Claude.
2. Case study thực tế
2.1. Hai kỹ sư viết lại hệ thống phục vụ hơn 1 tỷ người
Habitat là nền tảng lưu trữ trực tuyến của OpenAI. Nó cung cấp dữ liệu cho ChatGPT, Codex, API và các dịch vụ nội bộ, hiện xử lý hơn 70 triệu yêu cầu mỗi giây tại gần 40 khu vực địa lý và quản lý hơn 500 petabyte dữ liệu.
Habitat bắt đầu dưới dạng thư viện Python. Cách này giúp đội sản phẩm phát triển nhanh, nhưng khi số dịch vụ tăng, cập nhật phải phối hợp qua nhiều nhóm và dễ gây lỗi. OpenAI tách Habitat thành một dịch vụ trung tâm để kiểm soát định tuyến, quyền truy cập, mã hóa, ghi nhật ký và giới hạn lưu lượng tại một nơi.
| Chỉ số | Kết quả OpenAI công bố |
|---|---|
| Quy mô người dùng | Hơn 1 tỷ người mỗi tuần |
| Lưu lượng | Hơn 70 triệu yêu cầu mỗi giây |
| Dữ liệu | Hơn 500 petabyte |
| Nhóm viết lại | 2 kỹ sư cùng Codex và GPT‑5.5 |
| Hiệu quả CPU | Cao gấp 6 lần bản Python |
| Hiệu quả bộ nhớ | Cao gấp 15 lần bản Python |
| Lưu lượng trên Rust | 95% lưu lượng sản xuất |
Bài học không phải là mọi doanh nghiệp nên viết lại phần mềm bằng Rust. OpenAI cố ý giữ Python trong giai đoạn cần phát triển nhanh, rồi chỉ chuyển đổi khi hiệu suất trở thành nút thắt. AI giúp giảm sức người cho cuộc chuyển đổi, nhưng quyết định kiến trúc và kiểm thử vẫn do kỹ sư chịu trách nhiệm.
2.2. Devin dùng GPT‑6 Astra để tự kiểm thử và đưa bằng chứng
Cognition đang dùng GPT‑6 Astra trong Devin để sửa phần mềm, chạy thử rồi trả lại video hoặc ảnh chứng minh kết quả. Trong một ví dụ, Devin kiểm thử trò chơi iPhone trên trình mô phỏng, ghi hình hoạt động và liệt kê phần đã kiểm tra cùng phần còn bỏ ngỏ.
Cách làm này giúp người duyệt không chỉ nhận câu “đã xong”. Họ có bằng chứng để kiểm tra nhanh hơn. Tuy nhiên, OpenAI và Cognition chưa công bố chỉ số định lượng đầy đủ về tỷ lệ lỗi hoặc thời gian tiết kiệm, nên đây mới là tín hiệu triển khai đáng chú ý chứ chưa phải kết luận chung.
3. Cập nhật chính thức từ hãng
3.1. GitHub Copilot tự đóng nhận xét đã được sửa
Copilot Code Review có thể tự đánh dấu nhận xét đã được xử lý và tạo nội dung commit khi áp dụng đề xuất. Công cụ cũng được phép chạy lệnh build, kiểm thử và tập lệnh có mục tiêu sau lớp tường lửa dành cho Agent.
Ở mức Lite, GitHub dùng nhiều Agent cùng xem một thay đổi rồi hợp nhất phát hiện. Trong thử nghiệm của GitHub, cách này tăng trung bình 47% số nhận xét lỗi nghiêm trọng được nhà phát triển xử lý, 31% với mức trung bình và 11% với mức thấp, đồng thời giảm khoảng 8% chi phí đánh giá.
3.2. Doanh nghiệp có thể đo mức sử dụng Agent trong VS Code
Báo cáo Copilot Usage Metrics nay bổ sung dữ liệu hoạt động của cửa sổ VS Code Agents. Chủ doanh nghiệp, người quản lý thanh toán và vai trò được cấp quyền có thể đo mức sử dụng thông qua giao diện hoặc API.
Chỉ số này tách biệt với Agent Mode trong cửa sổ biên tập. Vì vậy, quản trị viên cần đọc đúng phạm vi trước khi dùng số liệu để đánh giá mức áp dụng AI của cả tổ chức.
4. Hướng dẫn vận hành Agent đáng chú ý
4.1. Theo dõi chất lượng và hạ tầng thành hai lớp
AWS trình bày mô hình giám sát hai lớp cho hệ thống nhiều Agent: một lớp liên tục chấm chất lượng câu trả lời và một lớp điều tra lỗi hạ tầng. Ví dụ minh họa là hệ thống đặt vé hàng không gồm bốn Agent.
Doanh nghiệp nên theo dõi cả “AI trả lời có đúng không?” và “máy chủ, mạng, quyền truy cập có hoạt động không?”. Chỉ quan sát CPU hoặc nhật ký lỗi sẽ bỏ sót trường hợp hệ thống vẫn chạy nhưng trả lời ngày càng kém.
4.2. Đừng chọn model chỉ bằng giá token
AWS công bố bộ công cụ đánh giá mã nguồn mở để so sánh model theo chi phí trên mỗi câu trả lời đúng, tổng chi phí cả hành trình Agent và chất lượng sản phẩm cuối cùng.
Một model rẻ theo đơn giá có thể phải gọi nhiều lần hoặc tạo nhiều lỗi hơn. Chỉ số dễ dùng hơn là: để hoàn thành đúng một công việc, doanh nghiệp thực sự tốn bao nhiêu tiền và bao nhiêu thời gian kiểm tra lại?
5. Doanh nghiệp nên làm gì tuần này?
- Chọn một chỉ số kết quả: đo chi phí cho mỗi công việc đúng, không chỉ đếm token hoặc số lần dùng AI.
- Yêu cầu bằng chứng: Agent phải trả lại kết quả kiểm thử, nguồn dữ liệu hoặc ảnh chụp trước khi được duyệt.
- Tách quyền theo môi trường: tài khoản thử nghiệm tuyệt đối không được có quyền xóa dữ liệu thật.
- Giám sát hai lớp: theo dõi cả chất lượng đầu ra và tình trạng hạ tầng.
- Chỉ viết lại khi có nút thắt rõ: giữ công nghệ hiện tại nếu nó còn đáp ứng mục tiêu; dùng AI để giảm rủi ro khi chuyển đổi.
6. Nguồn tham khảo trực tiếp
| Nhóm | Nguồn |
|---|---|
| Rủi ro và quản trị | Anthropic Threat Intelligence · Anthropic Frontier Red Team |
| Case study | OpenAI Habitat · OpenAI và Cognition |
| Cập nhật hãng | GitHub Copilot Code Review · GitHub Copilot Metrics |
| Hướng dẫn vận hành | AWS: giám sát Agent · AWS: đo chi phí theo kết quả |
Chú thích thuật ngữ
- Rust: ngôn ngữ lập trình hướng tới hiệu suất cao và an toàn bộ nhớ.
- Petabyte: đơn vị dữ liệu rất lớn; một petabyte tương đương khoảng một triệu gigabyte.
- CPU: bộ xử lý trung tâm của máy tính.
- AI Agent: hệ thống AI có thể tự chọn bước và dùng công cụ để hoàn thành một mục tiêu.
- Token: đơn vị nhỏ mà model dùng để đọc và tạo nội dung.
- Red Team: nhóm chủ động tìm cách hệ thống có thể bị lạm dụng hoặc thất bại để tăng mức an toàn.
Bản tin được tổng hợp và phân phối tự động bằng AIWeb – nền tảng web tự vận hành bằng AI Agent.