Vào tháng 6 năm 2025, Cisco đã công bố lỗ hổng CVE-2025-20282, một lỗ hổng có mức độ nghiêm trọng cao nhất trong Identity Services Engine của hãng. Nguyên nhân gốc rễ là do thiếu kiểm tra xác thực tệp tại điểm tải lên, điều này có thể cho phép kẻ tấn công chưa được xác thực đặt một tệp được tạo ra có chủ đích vào một thư mục có quyền truy cập đặc quyền và thực thi tệp đó với quyền root. Lỗi này nằm ở giai đoạn trước khi phát hiện, cụ thể là ở khâu hệ thống chấp nhận dữ liệu trước khi bất kỳ công cụ quét nào được chạy.
Mô hình đó không chỉ xuất hiện ở một sản phẩm duy nhất. Số lượng động cơ trong một ngăn xếp hiếm khi là yếu tố hạn chế. Một tệp phải được phân tích cú pháp trước khi có thể được đánh giá, và các định dạng hiện đại lồng ghép nội dung theo những cách mà quá trình phân tích cú pháp không phải lúc nào cũng tiếp cận được.
Tại sao kết quả chụp chiếu lại không phát hiện bất thường?
Quét dựa trên chữ ký hoạt động bằng cách so khớp các byte. Một công cụ lưu trữ cơ sở dữ liệu gồm các giá trị băm và mẫu byte được trích xuất từ các phần mềm độc hại đã biết, và một tệp phải chứa các byte trùng khớp thì mới bị phát hiện. Có một số yếu tố cản trở quá trình này khi nội dung được lồng ghép.
- Quá trình quét đọc tệp gốc, chứ không phải các đối tượng bên trong nó. Quá trình quét coi tệp trước mặt như một đối tượng nhị phân duy nhất và so sánh nó với cơ sở dữ liệu chữ ký. Nội dung lồng nhau được lưu trữ dưới dạng nén hoặc mã hóa, do đó một tệp thực thi nằm bên trong luồng tài liệu hầu như không có chuỗi byte trùng khớp với cùng tệp thực thi đó trên đĩa. Mẫu mà cơ sở dữ liệu đang tìm kiếm không tồn tại trong tệp ở dạng lưu trữ, và nó chỉ có thể khớp được sau khi luồng đó được giải nén.
- Một tệp không thể quét trông giống như một tệp bình thường. Cấu trúc bị lỗi khiến quá trình phân tích cú pháp bị gián đoạn. Bộ xử lý không thể hoàn tất quá trình đánh giá, do đó tệp này sẽ bị bỏ qua thay vì bị chặn, và kết quả có nghĩa là “không thể đánh giá” được truyền xuống các bước tiếp theo mà không thể phân biệt được với kết quả có nghĩa là “không tìm thấy gì”.
- Các định dạng cũng có thể gây hiểu lầm do bản chất thiết kế của chúng. Một tệp đa định dạng đáp ứng đồng thời hai đặc tả định dạng, do đó một trình phân tích cú pháp nhận diện tệp đó theo một định dạng, trong khi thực tế tệp lại hoạt động hoàn toàn theo một cách khác.
- Đoạn đệ quy có những giới hạn. Các vùng chứa lồng nhau bị giới hạn bởi giới hạn độ sâu và thời gian chờ quét, và điều này hoàn toàn có lý do chính đáng, bởi vì đệ quy không giới hạn chính là một nguy cơ gây ra tình trạng từ chối dịch vụ. Một tải trọng được đặt dưới giới hạn đó sẽ không bao giờ được đánh giá, và việc đặt nó ở vị trí sâu hơn phạm vi mà bộ xử lý có thể tiếp cận đòi hỏi nỗ lực ít hơn nhiều so với việc vô hiệu hóa nó.
Kết quả là một phán quyết không mang nhiều ý nghĩa như vẻ bề ngoài. Kết quả “sạch” có nghĩa là không tìm thấy mẫu nào khớp trong phần tệp mà công cụ có thể phân tích. Kết quả này không đưa ra bất kỳ nhận định nào về các thành phần bên trong tệp, cũng như không đưa ra nhận định nào về các lớp mà công cụ chưa từng mở.

Mỗi lớp đều có nhiệm vụ riêng. Thiếu một lớp.
Quét dựa trên chữ ký không bao giờ hoạt động độc lập. Các hệ thống phát hiện mối đe dọa dựa trên chữ ký ( Bảo mật tập tin ) hiện đại thường được thiết kế theo cấu trúc nhiều lớp, và các lớp xung quanh nó có nhiệm vụ bù đắp những lỗ hổng mà phương pháp so khớp mẫu không thể phát hiện được.
Việc xác định loại tệp giúp xác định loại thực sự của tệp dựa trên phần tiêu đề của tệp thay vì phần mở rộng được khai báo. Phương pháp này được thiết kế để hoạt động nhanh chóng và chỉ ở mức độ bề mặt, nhằm quyết định vị trí lưu trữ tệp thay vì phân tích nội dung bên trong tệp. Phân tích động quan sát hành vi của tệp trong một môi trường được kiểm soát. Đây là công cụ phù hợp để đối phó với các mối đe dọa chưa biết, và sẽ phát huy hiệu quả cao nhất khi được áp dụng một cách có chọn lọc thay vì áp dụng cho mọi tệp.

Mỗi lớp đều thực hiện chức năng của mình, nhưng khi dữ liệu tải (payload) không bao giờ được tách khỏi tệp chứa nó, hoặc nằm dưới ngưỡng độ sâu nhất định, thì nội dung đó sẽ không bao giờ tiếp cận được bất kỳ lớp nào trong số này, do đó việc thêm các lớp bảo vệ cũng không thể bù đắp được. “Điểm mù” này lan rộng nhất trong các định dạng hoàn toàn không có quy trình làm sạch dữ liệu: tệp cơ sở dữ liệu, dữ liệu GIS, tệp mô hình AI. Những định dạng này không thể được tái tạo, do đó lớp bảo vệ vốn dĩ sẽ phát hiện mối đe dọa không xác định lại không thể hoạt động theo định nghĩa.
Mảnh ghép còn thiếu chính là một lớp có nhiệm vụ duy nhất là xác lập “sự thật cơ bản” về cấu trúc trước tiên: phân tích tệp dựa trên đặc tả định dạng của nó, trích xuất mọi thành phần được nhúng bên trong, và cung cấp từng thành phần đó riêng lẻ cho tất cả các bước xử lý tiếp theo. Đó chính là vấn đề mà tính năng Xác thực Cấu trúc Tệp được xây dựng để giải quyết.
Cách xác thực cấu trúc tệp giúp thu hẹp khoảng cách
Quá trình xác thực cấu trúc tệp được thực hiện trước khi các thành phần còn lại của hệ thống bắt đầu hoạt động. Quá trình này xác thực tệp dựa trên các tiêu chuẩn định dạng của nó đối với hơn 160 loại tệp, bao gồm các định dạng GIS, cơ sở dữ liệu và mô hình AI, phân tách tệp thành các thành phần riêng lẻ và áp dụng chính sách cho từng thành phần.
Các đối tượng được chuyển đến công cụ có khả năng đánh giá chúng: Metascan™ Multiscanning, Adaptive Sandbox , Công nghệ Proactive DLP™, hoặc OPSWAT Alin AI. Tệp gốc tiếp tục được chuyển đến Công nghệ Deep CDR™ để khử độc khi cần thiết.
Điều quan trọng ở đây là tác động đến quá trình quét. So khớp chữ ký vẫn là cách nhanh nhất và tiết kiệm nhất để xác định phần mềm độc hại đã biết, và Xác thực Cấu trúc Tệp không thay thế bất kỳ công việc nào trong số đó. Nó thay đổi những gì được chuyển đến các công cụ quét. Phần tải trọng (payload) được gửi đến dưới dạng một tệp độc lập, đã được giải nén và phân loại sẵn, do đó công cụ quét sẽ so khớp trực tiếp với chính đối tượng đó thay vì một đoạn nén bị ẩn bên trong tệp cha. Các công cụ phát hiện được cung cấp chính xác các byte mà cơ sở dữ liệu của chúng được xây dựng để nhận diện, và tại thời điểm đó, chúng thực hiện những gì mà chúng luôn làm rất tốt.
Xem trong tệp
Cách rõ ràng nhất để minh họa điều này là một tệp tin vượt qua quá trình quét mà vẫn chứa mã độc. Chúng tôi đã tạo ra một bản thử nghiệm khái niệm, trong đó mã độc được ẩn bên trong một tệp PDF vô hại. Mẫu này sau đó đã được chạy qua một bộ sưu tập các công cụ chống phần mềm độc hại, và kết quả trả về là “sạch”.

Bước tiếp theo, chúng ta sẽ quét tệp này trong MetaDefender Core™ với tính năng Xác thực Cấu trúc Tệp được bật. Sau khi trích xuất các thành phần lồng nhau của tệp cha, tính năng Xác thực Cấu trúc Tệp sẽ gửi các đối tượng đầu ra đến các mô-đun xử lý tiếp theo để phân tích sâu hơn.


Các công cụ chống phần mềm độc hại Metascan™ Multiscanning đã đưa ra kết luận “Bị nhiễm”. Chính các cơ sở dữ liệu dấu hiệu trước đó không phát hiện ra mối đe dọa nào lại báo cáo có nhiễm virus ngay khi phần tải được trình bày dưới dạng một tệp riêng biệt.


Bắt đầu từ đâu
Kết quả quét sạch là thông tin cho biết những gì một công cụ quét có thể phân tích. Việc tệp đó có chứa nội dung nguy hiểm hay không là một vấn đề khác, và việc giải quyết vấn đề này là một vấn đề về cấu trúc cần được giải quyết trước khi công cụ phát hiện đầu tiên được chạy.
Việc đó có nghĩa là chỉ thực hiện Xác thực cấu trúc tệp hay kết hợp với quá trình làm sạch dữ liệu và phân tích động sẽ phụ thuộc vào các loại tệp, quy trình làm việc và các yêu cầu về tính toàn vẹn của bạn. Hãy liên hệ với chúng tôi để tìm hiểu xem sự kết hợp nào phù hợp nhất với môi trường của bạn.

