Scroll untuk baca artikel
Networking

Amazon: Pemadaman AWS minggu ini disebabkan oleh kegagalan DNS besar

74
×

Amazon: Pemadaman AWS minggu ini disebabkan oleh kegagalan DNS besar

Share this article
amazon:-pemadaman-aws-minggu-ini-disebabkan-oleh-kegagalan-dns-besar
Amazon: Pemadaman AWS minggu ini disebabkan oleh kegagalan DNS besar

AWS

Amazon mengatakan kegagalan DNS besar-besaran menjadi penyebab pemadaman besar-besaran AWS (Amazon Web Services) yang mematikan banyak situs web dan layanan online pada hari Senin.

Example 300x600

Sebagai BleepinComputer dilaporkan awal pekan iniinsiden ini berdampak pada pusat data penting Virginia Utara di wilayah US-EAST-1, memengaruhi pengguna di seluruh dunia, termasuk Amerika Serikat dan Eropa, selama lebih dari 14 jam.

Menurut a bedah mayat diterbitkan pada hari Kamis, kondisi balapan menyebabkan kegagalan DNS besar di infrastruktur Amazon DynamoDB, khususnya dalam sistem manajemen DNS yang mengontrol bagaimana permintaan pengguna dirutekan ke server yang sehat, yang menyebabkan penghapusan semua alamat IP untuk titik akhir regional layanan database secara tidak sengaja.

“Akar penyebab masalah ini adalah kondisi balapan laten dalam sistem manajemen DNS DynamoDB yang mengakibatkan catatan DNS kosong yang salah untuk titik akhir regional layanan (dynamodb.us-east-1.amazonaws.com) sehingga otomatisasi gagal diperbaiki,” kata Amazon.

“Ketika masalah ini terjadi pada pukul 23.48 PDT, semua sistem yang perlu terhubung ke layanan DynamoDB di Wilayah N. Virginia (us-east-1) melalui titik akhir publik segera mulai mengalami kegagalan DNS dan gagal terhubung ke DynamoDB. Ini termasuk lalu lintas pelanggan serta lalu lintas dari layanan AWS internal yang mengandalkan DynamoDB.”

Kegagalan DynamoDB memicu masalah berjenjang di seluruh infrastruktur AWS, menyebabkan sistem DNS DynamoDB berada dalam kondisi tidak konsisten yang tidak dapat diperbaiki oleh pemulihan otomatis, sehingga memerlukan intervensi operator manual.

Amazon telah menonaktifkan otomatisasi DNS yang bermasalah secara global dan mengambil tindakan untuk menghindari masalah serupa, termasuk menambahkan pemeriksaan perlindungan, meningkatkan mekanisme pembatasan, dan membangun rangkaian pengujian tambahan untuk membantu mendeteksi bug serupa di masa mendatang.

“Kami meminta maaf atas dampak yang ditimbulkan peristiwa ini kepada pelanggan kami. Meskipun kami memiliki rekam jejak yang kuat dalam mengoperasikan layanan kami dengan tingkat ketersediaan tertinggi, kami tahu betapa pentingnya layanan kami bagi pelanggan kami, aplikasi dan pengguna akhir mereka, serta bisnis mereka,” tambah Amazon.

“Kami tahu acara ini memberikan dampak yang signifikan kepada banyak pelanggan. Kami akan melakukan segala yang kami bisa untuk belajar dari acara ini dan menggunakannya untuk meningkatkan ketersediaan kami lebih jauh lagi.”