Trong bài viết đầu tiên của loạt bài này, tôi đã giới thiệu khái niệm về IntelligentFILE — bất kỳ tệp nào chứa thông tin thông minh nhúng, có khả năng kích hoạt một hành động cụ thể khi được xử lý, mở ra hoặc truyền đi. Tôi đã lập luận rằng tệp đã tiến hóa từ một “vật chứa” thụ động thành một “thành phần” chủ động, bản chất của nó đã thay đổi cơ bản, và hầu hết các kiến trúc bảo mật doanh nghiệp chưa theo kịp sự thay đổi này. Trong bài viết này, tôi muốn đi sâu hơn vào cơ chế của quá trình tiến hóa đó. Bởi vì việc hiểu cách AI đã biến đổi tệp là điều kiện tiên quyết để hiểu tại sao các chiến lược bảo mật cũ lại thất bại — và những gì một phản ứng hiện đại thực sự đòi hỏi.
Tóm tắt: Trí tuệ nhân tạo (AI) không chỉ đơn thuần làm tăng số lượng tệp tin. Nó còn khiến các tệp tin này trở nên mạnh mẽ hơn, thuyết phục hơn, khó phát hiện hơn và có tác động lớn hơn. AI đã giảm chi phí tạo ra nội dung phức tạp, nhạy bén với ngữ cảnh và có cấu trúc hợp lý xuống gần như bằng không. Và bằng cách đó, nó đã trao cho cả các doanh nghiệp lẫn các đối thủ cùng một bộ công cụ — mà không có cách nào đáng tin cậy để phân biệt ai đang nắm giữ chúng.
Sự đột biến, không chỉ là khối lượng
Khi phần lớn các nhà lãnh đạo an ninh thảo luận về mối đe dọa từ các tệp tin AI, họ thường viện dẫn các số liệu thống kê về quy mô. Dung lượng không gian dữ liệu toàn cầu được dự báo sẽ tăng gấp hơn hai lần từ năm 2022 đến năm 2026. Thực tế là hơn bốn trên năm công ty dịch vụ tài chính (81%) hiện nay cho biết họ đã áp dụng AI ở một mức độ nào đó. Các nền tảng tình báo mối đe dọa ghi nhận 500.000 tệp tin độc hại mỗi ngày. Những con số này là có thật và đáng kể; nhưng chúng chỉ mô tả quy mô của vấn đề, chứ không phải bản chất của nó.
Sự thay đổi sâu sắc hơn mang tính chất định tính. Trí tuệ nhân tạo (AI) đã thay đổi khả năng của các tệp tin, chứ không chỉ đơn thuần là số lượng của chúng.
2x+ | 81% | 1,265% |
Sự gia tăng khối lượng không gian dữ liệu toàn cầu, giai đoạn 2022–2026 | Các tổ chức tài chính cho biết họ đã áp dụng trí tuệ nhân tạo ở một mức độ nhất định vào năm 2026 |
Trước khi có AI, việc xây dựng, thử nghiệm và triển khai một phần mềm độc hại phức tạp đòi hỏi chuyên môn kỹ thuật sâu rộng. Rào cản lúc đó chính là kỹ năng của con người. Do đó, quy mô triển khai tất nhiên bị hạn chế. Sau khi có AI, rào cản đó đã sụp đổ. Các mô hình ngôn ngữ quy mô lớn tạo ra các tài liệu lừa đảo rất thuyết phục, không thể phân biệt được với các thông tin liên lạc hợp pháp. AI tạo ra các cấu trúc tệp độc đáo cho từng mục tiêu — điều mà các nhà nghiên cứu bảo mật gọi là nội dung đa hình — khiến việc phát hiện dựa trên chữ ký trở nên không đủ về mặt cấu trúc. Chi phí tạo ra một tài liệu độc hại hoặc giả mạo đã giảm xuống gần như bằng không. Và điều quan trọng là, các công cụ này giống hệt với những công cụ được sử dụng cho các mục đích hợp pháp.
THỜI KỲ TRƯỚC AI · 2010–2022 | THỜI ĐẠI INTELLIGENTFILE · 2023–HIỆN TẠI |
Các tệp dưới dạng tài liệu tĩnh | Các tệp như các tác nhân động |
|
|
Bốn cách mà trí tuệ nhân tạo (AI) đã thay đổi cách quản lý tệp tin
Có thể hiểu rõ nhất về quá trình phát triển của IntelligentFILE thông qua bốn sự thay đổi rõ rệt về khả năng mà trí tuệ nhân tạo (AI) đã mang lại — mỗi sự thay đổi này đều có tác động trực tiếp đến an ninh mà các công cụ truyền thống không được thiết kế để giải quyết.
1. Xây dựng đa hình trên quy mô lớn
Phần mềm độc hại truyền thống có cấu trúc cố định; một khi được xác định, chúng có thể được phân loại và phát hiện thông qua chữ ký. Phần mềm độc hại do trí tuệ nhân tạo (AI) tạo ra không có cấu trúc cố định. Mỗi biến thể có thể có cấu trúc độc nhất, được điều chỉnh theo ngữ cảnh của mục tiêu và được thiết kế để lẩn tránh các công cụ phát hiện cụ thể mà kẻ tấn công đã thử nghiệm trước đó. Đây không chỉ là một sự cải thiện nhỏ về khả năng lẩn tránh. Đây chính là việc loại bỏ giả định cơ bản mà cơ chế phát hiện dựa trên chữ ký dựa vào.
2. Tính hợp lý theo ngữ cảnh ở cấp độ nội dung
Trước khi có sự xuất hiện của trí tuệ nhân tạo tạo sinh (LLM), việc tạo ra một tài liệu lừa đảo thuyết phục đòi hỏi rất nhiều công sức của con người — từ nghiên cứu, soạn thảo, định dạng cho đến đảm bảo tính chính xác về bối cảnh. Tuy nhiên, kết quả thu được vẫn thường bị các chuyên gia phân tích có kinh nghiệm phát hiện là đáng ngờ. Ngày nay, các mô hình ngôn ngữ lớn (LLMs) tạo ra các tài liệu lừa đảo, hóa đơn giả mạo, hướng dẫn chuyển khoản bịa đặt và các tệp KYC tổng hợp mà về mặt ngữ cảnh không thể phân biệt được với các bản gốc hợp pháp. Hơn 82% email lừa đảo được phát hiện hiện nay chứa nội dung do AI tạo ra. Lớp kỹ thuật xã hội đã được công nghiệp hóa và trở nên gần như không gặp trở ngại nào.
3. Sự mập mờ về nguồn gốc
Khi một tệp tin được tạo ra bởi trí tuệ nhân tạo (AI), các dấu hiệu nguồn gốc truyền thống sẽ trở nên không đáng tin cậy. Siêu dữ liệu có thể bị làm giả. Không thể xác định tác giả là con người. Nội dung có vẻ như được tạo ra từ bên trong thực tế có thể xuất phát từ cơ sở hạ tầng LLM của bên thứ ba nằm ngoài phạm vi bảo mật của tổ chức. Đối với các dịch vụ tài chính — nơi tính xác thực của một tài liệu có thể quyết định tính hợp lệ của một giao dịch, tính hợp pháp của một sự kiện đăng ký mới hoặc độ chính xác của một mô hình rủi ro — sự mờ ám về nguồn gốc không chỉ là một trở ngại. Đó là một lỗ hổng cấu trúc.
4. Ngộ độc RAG: khi tệp tin trở thành “bộ nhớ tổ chức”
Sự phát triển thứ tư và có lẽ là quan trọng nhất chỉ dành riêng cho các doanh nghiệp đã áp dụng hệ thống Tạo nội dung được tăng cường bằng truy xuất (RAG) — đến năm 2026, điều này sẽ bao gồm phần lớn các tổ chức tài chính. Trong kiến trúc RAG, mọi tệp tin được nhập vào đều trở thành nguồn thông tin đáng tin cậy cho mô hình AI đọc nó. Khi một nhà phân tích đặt câu hỏi cho hệ thống, họ sẽ nhận được câu trả lời được trích xuất từ các tài liệu đã được lập chỉ mục. Chỉ cần một tệp duy nhất chưa được làm sạch, được tạo ra với mục đích xấu hoặc do AI “ảo tưởng” xâm nhập vào kho dữ liệu đã được lập chỉ mục đó cũng không chỉ mang lại rủi ro cho chính nó. Nó còn làm ô nhiễm cơ sở kiến thức của tổ chức — và AI sẽ cung cấp thông tin sai lệch đó cho mọi truy vấn tiếp theo, trên quy mô lớn, với uy tín của một hệ thống nội bộ đáng tin cậy.
01Tệp đã được gửi đến Tài liệu do trí tuệ nhân tạo (AI) tạo ra hoặc bị chỉnh sửa được gửi đến qua email, tải lên, API hoặc kênh chuyển tiếp | 02Đạt tiêu chuẩn kiểm tra Máy bay một động cơ không phát hiện thấy bất kỳ dấu hiệu nào đã biết. Hồ sơ được xác nhận là không có vấn đề gì. | 03Được ghi nhận là sự thật Hệ thống RAG nhập tệp tin này. Tệp tin này trở thành một phần của kho kiến thức tổ chức | 04Ngộ độc toàn thân Mọi truy vấn ở giai đoạn sau đều lấy dữ liệu từ nguồn bị hỏng. Rủi ro không còn được kiểm soát — mà đã lan rộng |
Đây chính là rủi ro RAG. Một ngân hàng sử dụng máy quét đơn động cơ chỉ cần một tệp tin bị làm giả hoặc bị AI che giấu là đủ để làm hỏng toàn bộ cơ sở kiến thức nội bộ của mình. Một khi tệp tin độc hại được nhập vào hệ thống, AI sẽ cung cấp nội dung đó như là “sự thật chính thức” cho mọi nhân viên khi họ tra cứu. Phạm vi ảnh hưởng không phải là chính tệp tin đó, mà là tất cả những gì tệp tin đó tác động đến.
Mặt trận tấn công mới: Vượt ra ngoài hộp thư đến
Một khía cạnh quan trọng trong quá trình phát triển của IntelligentFILE là việc mở rộng diện tích tấn công ra ngoài hộp thư đến — vốn từ trước đến nay luôn là trọng tâm chính của Bảo mật tập tin . Ngày nay, mọi điểm tiếp nhận dữ liệu đều là một kênh tấn công.
- Cloud và lưu trữCloud : Mỗi tệp được tải lên SharePoint, OneDrive, S3 hoặc một nền tảng cộng tác đều được coi là một sự kiện nhập liệu. Các tệp đang được lưu trữ tiềm ẩn những rủi ro tương tự như các tệp đang được truyền tải — và thường ít được quét kỹ lưỡng hơn.
- API và quy trình làm việc tự động: Các đường ống xử lý tệp tự động giữa các hệ thống — nền tảng tuân thủ, hồ dữ liệu, dữ liệu đầu vào cho mô hình AI — hoạt động với tốc độ tính bằng mili giây. Việc quét trong môi trường thử nghiệm truyền thống không thể theo kịp tốc độ này mà không trở thành điểm nghẽn.
- Biểu mẫu trực tuyến và cổng thông tin dành cho khách hàng: Mỗi lần tải lên tài liệu xác minh danh tính (KYC), đơn xin vay, yêu cầu bồi thường bảo hiểm và biểu mẫu đăng ký nhà đầu tư đều là một điểm tiếp nhận tệp tin. Các cổng thông tin dành cho khách hàng là những môi trường có lưu lượng lớn, mức độ tin cậy cao và do đó cũng tiềm ẩn rủi ro lớn tương ứng.
- Các tệp liên quan đến chuỗi cung ứng và từ bên thứ ba: Các cuộc tấn công vào chuỗi cung ứng do trí tuệ nhân tạo (AI) tạo ra hiện đã được nhúng vào bên trong các tệp đáng tin cậy, trông có vẻ hợp pháp, xuất phát từ các nhà cung cấp và đối tác đã biết. Nguồn gốc của các tệp này là đáng tin cậy, nhưng nội dung bên trong có thể không phải vậy. Các công cụ truyền thống không có cơ chế để phân biệt giữa chúng.
- Phương tiện lưu trữ di động và truyền tải vật lý: Đối với các môi trường chịu sự quản lý chặt chẽ và cách ly hoàn toàn — đặc biệt là trong các hoạt động dịch vụ tài chính, cơ quan chính phủ và cơ sở hạ tầng trọng yếu phương tiện lưu trữ vật lý vẫn là kênh nhập tệp chính và thường là một ranh giới bảo mật chưa được đầu tư đầy đủ.
Tại sao mô hình phát hiện lại là mô hình sai lầm
Phương pháp bảo mật chủ đạo đối với các mối đe dọa từ tệp tin từ trước đến nay là phát hiện: quét tệp tin, so sánh với các mẫu đã biết, sau đó đánh dấu hoặc cho phép. Mô hình này từng phù hợp với một thế giới mà các mối đe dọa có cấu trúc cố định, tốc độ sản sinh bị giới hạn bởi con người và các dấu hiệu hành vi có thể nhận diện được. Thế giới đó giờ đây không còn tồn tại nữa.
“Việc phát hiện dựa trên giả định rằng bạn có thể phân biệt được giữa một tệp an toàn và một tệp nguy hiểm. Trí tuệ nhân tạo (AI) đã chứng minh giả định đó là sai lầm. Giải pháp thông minh không phải là việc phát hiện tốt hơn, mà là loại bỏ ngay từ đầu sự cần thiết phải tin tưởng vào tệp đó.”
Trong kỷ nguyên IntelligentFILE, khoảng cách giữa những gì các công cụ phát hiện có thể xác định một cách đáng tin cậy và những gì các mối đe dọa do AI tạo ra có khả năng sản sinh ra là một khoảng cách mang tính cấu trúc, chứ không phải là sự chênh lệch nhỏ giọt. Các công cụ đơn động cơ có tỷ lệ phát hiện dưới 50% đối với các mối đe dọa do AI tạo ra ngay từ giờ đầu tiên. Cơ sở dữ liệu chữ ký chậm hơn mối đe dọa từ 24–72 giờ — một khoảng thời gian dài vô tận trong môi trường mà các tải trọng đa hình được tạo ra cho từng mục tiêu, từng chiến dịch. Và vấn đề “nhìn lần đầu” có nghĩa là ngay khi gặp phải một cấu trúc mối đe dọa mới do AI tạo ra, các công cụ cũ sẽ không thể phát hiện ra nó cho đến khi các chữ ký được cập nhật — một khoảng thời gian mà những kẻ tấn công tích cực khai thác.
KHẢ NĂNG | MÁY BAY DÂN DỤNG MỘT ĐỘNG CƠ CỔ ĐIỂN | TƯ THẾ BẮT BUỘC |
Phần mềm độc hại AI đa hình | Mù — không có chữ ký cố định | Phân tích cấu trúc độc lập với chữ ký |
Nội dung được làm mờ bằng trí tuệ nhân tạo | Tỷ lệ phát hiện dưới 50% | Xác thực chéo đa mô-đun tại giai đoạn nhập liệu |
Các mối đe dọa phát sinh đột ngột | Thời gian chậm trễ trong việc ký nhận từ 24–72 giờ | Phân tích heuristic và hành vi tại thiết bị đầu cuối |
Tính toàn vẹn của tập dữ liệu RAG | Không quan sát thấy sau khi nuốt vào | Phải tiến hành khử trùng trước khi lập chỉ mục, chứ không phải sau đó |
API truyền tệp API | Tình trạng tắc nghẽn do độ trễ | Kiểm tra ở quy mô mili giây mà không làm giảm năng suất |
Giấy tờ KYC / giấy tờ tùy thân giả mạo | Không có lớp xác thực nội dung | Kiểm tra nội dung sâu hơn so với việc quét bề mặt |
Sự chuyển đổi chiến lược: Từ phát hiện sang khử trùng
Nếu việc phát hiện không còn đủ, thì điều gì sẽ thay thế nó? Câu trả lời là một sự thay đổi về phương pháp tiếp cận — từ mô hình đặt câu hỏi “tập tin này có độc hại không?” sang mô hình đặt câu hỏi “liệu tôi có thể loại bỏ hoàn toàn rủi ro từ tập tin này trước khi nó xâm nhập vào môi trường hay không?”
Đây chính là nguyên lý hoạt động của Công nghệ Deep CDR™, công nghệ này không cố gắng phát hiện nội dung độc hại mà thay vào đó sẽ giải mã tệp, loại bỏ tất cả các thành phần hoạt động bất kể chúng có vẻ đe dọa hay không, và tái tạo một phiên bản có cấu trúc sạch để sử dụng. Đây là phương pháp “không tin tưởng” được áp dụng ở cấp độ tệp: không có tệp nào được coi là đáng tin cậy, mọi tệp đều được làm sạch, và gánh nặng chứng minh được loại bỏ hoàn toàn khỏi công cụ kiểm tra.
ĐIỂM BẬT MỚI NĂM 2026 Chi phí để tạo ra một tài liệu độc hại đã giảm xuống gần như bằng không. Chi phí cho mỗi vụ vi phạm an ninh trong lĩnh vực dịch vụ tài chính đã lên tới 4,4 triệu đô la. Sự chênh lệch này chưa bao giờ lớn đến thế — và mô hình bảo mật dựa trên giả định rằng việc phát hiện có thể thu hẹp khoảng cách đó đã được thiết kế cho một thời đại khác. IntelligentFILE đòi hỏi một cách ứng phó khác biệt.
Quá trình phát triển của IntelligentFILE vẫn chưa hoàn tất
Khi các mô hình trí tuệ nhân tạo (AI) ngày càng trở nên mạnh mẽ hơn và các quy trình làm việc tự chủ trở thành xu hướng phổ biến, tệp tin sẽ tiếp tục sở hữu những khả năng mới — cũng như những rủi ro mới. Tuy nhiên, bước ngoặt đã thực sự diễn ra. Tệp tin đã vượt qua ngưỡng chuyển đổi từ một đối tượng thụ động sang một tác nhân có ảnh hưởng đáng kể. Kiến trúc cần thiết để quản lý nó ở mức độ khả năng đó hiện đã có sẵn. Câu hỏi đặt ra là liệu các doanh nghiệp có triển khai nó trước khi chi phí của việc không làm như vậy trở nên không thể tránh khỏi hay không.
Trong bài viết tiếp theo của loạt bài này, chúng ta sẽ chuyển sang thực tiễn vận hành: sự phát triển của IntelligentFILE có ý nghĩa như thế nào đối với Trung tâm Vận hành An ninh (SOC) — những đội ngũ chịu trách nhiệm phát hiện, phân loại mức độ ưu tiên và ứng phó với các mối đe dọa mà bối cảnh tệp tin mới này tạo ra hàng ngày.
Ngăn chặn các mối đe dọa trước khi chúng xâm nhập vào hệ thống tài chính
Rủi ro liên quan đến tệp tin là rủi ro tài chính. OPSWAT dữ liệu khách hàng, hệ thống giao dịch và đảm bảo tuân thủ quy định thông qua giải pháp phòng ngừa mối đe dọa dữ liệu nhiều lớp.
Tìm hiểu thêm về cách bạn có thể bảo vệ tổ chức của mình bằngcác giải phápOPSWAT dành cho các tổ chức tài chính.
