
Sự cố mất điện diện rộng trên mạng lưới của Cloudflare đã gây ra gián đoạn toàn cầu vào thứ Ba, khiến hàng triệu người dùng không thể truy cập các dịch vụ phổ biến như X và ChatGPT , cùng nhiều dịch vụ khác. Sự cố xảy ra vào khoảng giữa trưa (giờ Tây Ban Nha), cho thấy sự liên kết chặt chẽ của cơ sở hạ tầng hỗ trợ internet.
Công ty Mỹ này, một nhân tố chủ chốt trong lĩnh vực CDN và an ninh mạng , đã xác nhận đang điều tra hàng loạt 500 lỗi và sự cố ngừng hoạt động trong bảng điều khiển và API của mình, đồng thời đang nỗ lực khôi phục theo từng giai đoạn. Các báo cáo về sự cố này lan rộng ở Tây Ban Nha và phần còn lại của châu Âu, ảnh hưởng đến mọi lĩnh vực từ mạng xã hội đến giải trí kỹ thuật số và, ở mức độ thấp hơn, dịch vụ tài chính.
Niên đại của sự kiện
Những cảnh báo đầu tiên được ghi nhận vào khoảng 12:30 (giờ bán đảo) , với đỉnh điểm sự cố vào khoảng 13:00. Cloudflare đã xác nhận tình hình ngay trước 1:00, khoảng 12:48 , và bắt đầu áp dụng các biện pháp khắc phục; đến 13:15, nhiều dịch vụ bắt đầu phục hồi, mặc dù vẫn còn một số lỗi tồn đọng trong một số môi trường.
Theo nguồn tin từ công ty, một sự gia tăng đột biến bất thường về lưu lượng truy cập đã được phát hiện trên một trong các dịch vụ của họ vào khoảng 11:20 sáng , gây ra lỗi nghiêm trọng trên nhiều thành phần của mạng lưới. Mặc dù phần lớn lưu lượng truy cập vẫn tiếp tục được duy trì, nhưng sự suy giảm này đã gây ra những gián đoạn đáng kể đối với các ứng dụng được sử dụng thường xuyên.
Các dịch vụ có tác động cao bị ảnh hưởng
Phạm vi ảnh hưởng rất rộng, tác động đến các nền tảng hàng đầu thuộc nhiều lĩnh vực, đáng chú ý nhất là X (trước đây là Twitter) và ChatGPT . Các sự cố cũng được báo cáo trên các công cụ tạo và lưu trữ nội dung, trò chơi trực tuyến và một số trang web doanh nghiệp có lưu lượng truy cập cao, tạo ra hiệu ứng domino đáng kể.
- Mạng xã hội và truyền thông: X, Mename me và cổng thông tin giám sát Downdetector Họ chỉ ra lỗi hoặc thời gian tải chậm.
- Trí tuệ nhân tạo và năng suất: ChatGPT, Canva, Dropbox và một số dịch vụ kinh doanh bị gián đoạn.
- Tài chính và dịch vụ: các vấn đề đã được báo cáo trong Coinbase và các trang web của công ty như MoodyNgười dùng đã đề cập đến những khó khăn cụ thể trong các thực thể như Ngân hàng Caixa.
- Giải trí và trò chơi điện tử: League of Legends và các ứng dụng giải trí như Grindr Họ bị gián đoạn.
- Giao thông vận tải và viễn thông: sự cố trong NJ Transit và sự cố ngừng hoạt động tạm thời hoặc suy thoái ở các nhà điều hành như Movistar.
Ngoài tác động đến khách hàng, các dịch vụ nội bộ của Cloudflare cũng bị ảnh hưởng trong sự cố này. Là một phần của nỗ lực khắc phục, công ty đã vạch ra các hành động cụ thể như tạm thời vô hiệu hóa WARP tại London để ổn định mạng và sau đó kích hoạt lại khi mức độ lỗi trở lại bình thường.
Điều gì đã sai và điều gì đã được biết
Trong các tuyên bố ban đầu, công ty đã phân loại sự cố này là sự suy giảm chất lượng dịch vụ nội bộ và đảm bảo rằng họ đang thực hiện các thay đổi để đẩy nhanh quá trình khắc phục. Hiện tại, chưa có bằng chứng về một cuộc tấn công từ bên ngoài ; giả thuyết hoạt động cho thấy vấn đề nằm ở cơ sở hạ tầng của chính công ty, và hiện vẫn đang được phân tích.
Trong thời điểm sự cố lên đỉnh điểm, người dùng gặp phải lỗi 500 trên diện rộng và lỗi tải nội dung, cũng như các vấn đề với Bảng điều khiển và API của Cloudflare . Công ty cho biết sẽ đăng tải các bản cập nhật trên trang trạng thái của mình ( cloudflarestatus.com ) và phân tích chuyên sâu trên blog của mình ( blog.cloudflare.com ).
Tác động ở Tây Ban Nha và Châu Âu
Phần lớn các cảnh báo ở Tây Ban Nha tập trung vào đầu giờ chiều, trùng với giờ làm việc và thời điểm sử dụng máy tính để bàn cao điểm. Cả người dùng cá nhân và doanh nghiệp đều bị ảnh hưởng , với các mạng xã hội, nền tảng trí tuệ nhân tạo, dịch vụ ngân hàng và viễn thông gặp sự cố gián đoạn.
Đối với các tổ chức châu Âu dựa vào Cloudflare làm mạng phân phối nội dung (CDN) và lớp bảo mật , sự cố này gây ra hiện tượng tăng đột biến độ trễ, gián đoạn một phần và lỗi định tuyến, buộc các nhóm CNTT phải triển khai các biện pháp dự phòng trong khi quá trình khôi phục diễn ra trên toàn mạng lưới toàn cầu của công ty.
Đặt lại và các bước tiếp theo
Cloudflare báo cáo rằng tỷ lệ lỗi đã giảm sau khi các thay đổi được thực hiện, và quá trình phục hồi đang lan rộng khắp mạng lưới của họ. Ưu tiên trước mắt là đảm bảo sự ổn định của lưu lượng truy cập , tiếp theo là phân tích nguyên nhân gốc rễ toàn diện để ngăn chặn các sự cố tương tự tái diễn.
Sự cố này làm dấy lên cuộc tranh luận về việc phụ thuộc vào các nhà cung cấp cơ sở hạ tầng lớn . Nó xảy ra ngay sau các sự cố ngừng hoạt động gần đây tại AWS và Azure , và nhấn mạnh rằng một lỗi cục bộ có thể gây ra hậu quả trên diện rộng khi hàng triệu dịch vụ phụ thuộc vào cùng một lớp hạ tầng quan trọng.
Sự cố mất điện đã cho thấy rõ: một mắt xích yếu duy nhất có thể gây ra hậu quả trên nhiều lĩnh vực cùng một lúc. Với hầu hết các nền tảng hiện đã hoạt động trở lại, sự chú ý đang tập trung vào báo cáo kỹ thuật chi tiết về những gì đã xảy ra, cách khắc phục và những thay đổi sẽ được thực hiện để tăng cường khả năng phục hồi của hệ sinh thái kỹ thuật số.
