Gửi nhật ký, cảnh báo và dữ liệu đo lường qua bộ Data Diode

Tìm hiểu cách thức
Chúng tôi sử dụng trí tuệ nhân tạo để dịch trang web và mặc dù chúng tôi luôn cố gắng đảm bảo độ chính xác, nhưng đôi khi bản dịch có thể không đạt độ chính xác tuyệt đối. Mong quý vị thông cảm.

Các rủi ro bảo mật của mô hình LLM xuất phát từ các tệp Pickle và các tải trọng xếp chồng

Các mô hình AI đã được huấn luyện sẵn được tải xuống từ các nền tảng công khai là mã có thể thực thi, và quy trình xử lý năm lớp của MetaDefender Aether™ sẽ kiểm tra chúng trước khi chúng vượt qua ranh giới tin cậy của bạn.
Qua Triet Trần Minh, Chuyên viên phân tích phát hiện mối đe dọa
Chia sẻ bài viết này

Bảo mật mô hình LLM (Mô hình Ngôn ngữ Lớn) là quy trình kiểm tra các tệp mô hình AI đã được huấn luyện sẵn để phát hiện mã độc được nhúng bên trong trước khi chúng được tải vào môi trường. Các tệp mô hình ở các định dạng như pickle, PyTorch, TensorFlow và Keras có thể thực thi mã ngay khi được tải, khiến chúng trở thành một rủi ro trong chuỗi cung ứng tương đương với việc chạy phần mềm chưa được kiểm định.

Tóm tắt / Những điểm chính

  • Các mô hình đã được huấn luyện sẵn tải xuống từ Hugging Face, Kaggle hoặc PyPI là mã có thể thực thi, chứ không phải dữ liệu tĩnh
  • Theo báo cáo “Software ” năm 2026 của JFrog (Supply Chain ), 53% các tổ chức lấy các mô hình trực tiếp từ các kho lưu trữ công khai, nơi các nhà nghiên cứu đã xác định được khoảng 495 mô hình độc hại có khả năng đánh cắp thông tin đăng nhập và xâm nhập toàn bộ hệ thống
  • Các định dạng dựa trên Pickle (.pt, .pth, .bin, .pkl) thực thi các hàm tùy ý thông qua lệnh REDUCE trong quá trình tải; đây cũng chính là lỗ hổng cấu trúc mà các đồ thị TensorFlow và các lớp Lambda của Keras cũng mắc phải
  • Safetensors loại bỏ hoàn toàn bộ máy thực thi, nhưng vẫn còn hàng trăm nghìn mô hình ở định dạng cũ đang được lưu hành, và việc một tệp trong kho lưu trữ được coi là an toàn không đảm bảo rằng phần còn lại của kho lưu trữ đó cũng an toàn
  • MetaDefender Aether™ kiểm tra các tệp mô hình trên năm lớp phân tích, phát hiện các mối đe dọa như các tải trọng “stacked pickle” vốn không bị phát hiện bởi các trình quét truyền thống

Các mô hình AI đã được huấn luyện sẵn là mã có thể thực thi vượt qua ranh giới tin cậy

Việc xây dựng một mô hình ngôn ngữ quy mô lớn từ đầu đòi hỏi dữ liệu, tài nguyên tính toán và thời gian – những thứ mà phần lớn các tổ chức không có. Thay vào đó, các nhóm thường tải xuống các mô hình đã được huấn luyện sẵn từ các nền tảng công khai như Hugging Face, Kaggle và PyPI. Sự phụ thuộc này đã tạo ra một lỗ hổng tấn công trong chuỗi cung ứng mà nhiều chương trình bảo mật vẫn còn bỏ qua.

Các tổ chức hiện nay đã tiến hành kiểm tra kỹ lưỡng các thư viện mã nguồn mở và hình ảnh container mà họ đưa vào môi trường của mình. Tuy nhiên, rất ít tổ chức áp dụng mức độ kiểm tra tương tự đối với các mô hình AI mà đội ngũ của họ tải xuống, mặc dù tệp mô hình không chỉ đơn thuần là một bảng tính chứa các con số. Tùy thuộc vào định dạng, tệp mô hình có thể là một chương trình sẽ chạy ngay khi được tải vào.

Chỉ riêng Hugging Face đã lưu trữ hơn một triệu mô hình, phần lớn trong số đó chưa từng trải qua quá trình đánh giá an toàn. Theo báo cáo “Software ” của JFrog Supply Chain State of the Union 2026, 53% tổ chức hiện nay lấy mô hình trực tiếp từ các kho lưu trữ công khai, và các nhà nghiên cứu đã xác định được khoảng 495 mô hình độc hại trong các kho lưu trữ đó, có khả năng đánh cắp thông tin đăng nhập, thực thi mã và chiếm quyền kiểm soát toàn bộ hệ thống. Một mô hình LLM là phần mềm có thể thực thi, vượt qua ranh giới tin cậy.

Cách các mối đe dọa dựa trên mô hình đã phát triển từ lý thuyết đến kỹ thuật né tránh

Mối đe dọa này phát triển theo các giai đoạn: cảnh báo học thuật, thử nghiệm khái niệm, các vụ lạm dụng chuỗi cung ứng trong thực tế và các kỹ thuật né tránh được thiết kế để đánh lừa các công cụ quét.

Sự phát triển của các mối đe dọa dựa trên mô hình, 2018–2026

Giai đoạn

Khung thời gian

Điều gì đã thay đổi

Bằng chứng tiêu biểu

Lý thuyết

2018

Các nhà nghiên cứu cảnh báo rằng các mô hình đã được huấn luyện sẵn và tái sử dụng từ các nguồn không đáng tin cậy có thể bị thao túng

Các cuộc tấn công lợi dụng việc tái sử dụng mô hình đối với các hệ thống học sâu

Chứng minh tính khả thi

2023–2024

Các mô hình độc hại thực sự đã xuất hiện; các định dạng dựa trên pickle được xác định là chứa các tải trọng hoạt động

star23/baller13, một mô hình sử dụng cấu trúc “reverse shell”, đã xuất hiện trên Hugging Face

Trong tự nhiên

2024–2025

Khối lượng tăng lên, nhờ việc giao hàng qua chuỗi cung ứng thông qua các hệ thống đăng ký bưu kiện

Các gói PyPI mang thương hiệu Alibaba báo hiệu sự xuất hiện của các cuộc tấn công vào chuỗi cung ứng liên quan đến mô hình ngôn ngữ lớn (LLM)

Kỹ thuật né tránh nâng cao

2024–2025

Các gói hàng được xếp lớp, xếp chồng lên nhau, được thiết kế nhằm đánh lừa các cuộc kiểm tra nhanh

Một bản thử nghiệm khái niệm (PoC) sử dụng kỹ thuật “stacked pickle” đã đạt 0/70 trên VirusTotal

Một định dạng an toàn hơn

2023–2026

Một định dạng chỉ chứa dữ liệu, không thể chứa mã, đã được giới thiệu, nhưng các mô hình cũ vẫn được sử dụng rộng rãi

Safetensors trở thành tùy chọn mặc định cho các mẫu sản phẩm mới được ra mắt

Các tệp Pickle và PyTorch sẽ thực thi mã ngay khi được tải vào bộ nhớ

Pickle là định dạng tuần tự hóa gốc của Python và từng là phương thức tiêu chuẩn để lưu các mô hình vào đĩa trong nhiều năm. PyTorch đã phát triển các tệp .pt, .pth và .bin dựa trên nền tảng này, và nhiều mô hình đã được công bố dưới các định dạng đó. Ngày nay đã có những lựa chọn an toàn hơn, nhưng chúng đã bị loại bỏ như một loại “ngôn ngữ kinh doanh trừu tượng”. Một phần lớn các mô hình vẫn đang lưu hành trên các nền tảng công cộng vẫn dựa trên Pickle, và các nhóm phát triển vẫn tải chúng hàng ngày.

Định dạng Pickle được sử dụng rộng rãi để lưu trữ các mô hình LLM

Pickle không chỉ lưu trữ dữ liệu. Đây là một luồng lệnh mà máy ảo thực thi trong quá trình tải tệp và tái tạo các đối tượng Python. Luồng này có thể gọi các hàm tùy ý, do đó việc tải một mô hình dựa trên Pickle cũng có thể thực thi mã.

Kẻ tấn công lợi dụng lệnh REDUCE trong định dạng pickle, lệnh này yêu cầu trình tải (loader) gọi một hàm cụ thể với các tham số do kẻ tấn công chọn trong quá trình giải nén (unpickling). Điều này có thể được sử dụng để khởi chạy một reverse shell, cài đặt payload giai đoạn hai hoặc ghi đè lên khóa SSH, trong khi mô hình vẫn được tải và hoạt động như một tệp hợp lệ.

TensorFlow và Keras đều tiềm ẩn những rủi ro tương tự. Các đồ thị TensorFlow độc hại có thể lén lút đưa các toán tử ghi tệp hoặc toán tử mạng vào đồ thị tính toán, trong khi các lớp Lambda của Keras có thể chứa mã byte Python đã được mã hóa (marshaled) và sẽ được giải mã khi tải. Mỗi định dạng này đều cho phép tệp chứa các hành vi có thể thực thi. Rủi ro này mang tính cấu trúc, do đó việc vá một lỗ hổng duy nhất không thể loại bỏ được nó. Hạn chế này đã buộc ngành công nghiệp phải tìm kiếm một định dạng an toàn hơn.

Một reverse shell được nhúng trong tệp mô hình dựa trên định dạng pickle

Các sự cố trong thực tế đã biến lý thuyết này thành một mối đe dọa “ Supply Chain ”

Các cảnh báo về các cuộc tấn công tái sử dụng mô hình lần đầu tiên xuất hiện vào năm 2018. Sau đó, các nhà nghiên cứu đã chứng minh rằng rủi ro này thực sự tồn tại trong thực tế. Vào tháng 1 năm 2024, một mô hình có tên star23/baller13 đã xuất hiện trên Hugging Face với một reverse shell được ẩn bên trong tệp PyTorch. Mô hình này có thể cung cấp quyền truy cập từ xa trong khi vẫn được nhận diện như một mô hình hợp lệ.

Cảnh báo từ Star23/baller13 trên Hugging Face. Nguồn: https://huggingface.co/star23/baller13
Gói PyPi độc hại
Gói PyPi độc hại

Đến tháng 5 năm 2025, mối đe dọa đã lan sang lĩnh vực chuỗi cung ứng truyền thống. Những kẻ tấn công đã phát hành các gói phần mềm trên PyPI có tên aliyun-ai-labs-snippets-sdk, ai-labs-snippets-sdk và aliyun-ai-labs-sdk, giả mạo bộ công cụ AI của Alibaba và âm thầm tải một mô hình độc hại khi người dùng sử dụng. Các gói này chỉ tồn tại trong vòng chưa đầy 24 giờ nhưng đã được tải xuống khoảng 1.600 lần; điều này nhắc nhở chúng ta rằng một khoảng thời gian tiếp xúc ngắn ngủi là quá đủ khi quá trình giải quyết phụ thuộc tự động thực hiện việc tải xuống.

Chương trình Thạc sĩ Luật (LLM) về các cuộc tấn công chuỗi cung ứng

Các gói dữ liệu dồn chồng nhau đánh bại các trình quét truyền thống

Đến năm 2024, các kẻ tấn công đã nhắm mục tiêu vào các công cụ quét được phát triển để phát hiện các mô hình độc hại. Ví dụ rõ ràng nhất là kỹ thuật “Stacked Pickle”, trong đó các đối tượng pickle được lồng ghép nhiều lớp và các lệnh độc hại được phân tán khắp các lớp, sau đó được đóng gói bằng các thuật toán nén và mã hóa.

Mỗi lớp trông có vẻ vô hại khi được kiểm tra riêng lẻ, do đó các công cụ quét và quá trình kiểm tra thủ công chỉ dừng lại ở bề mặt sẽ không phát hiện được gì. Khi mô hình được tải, các lớp này sẽ được giải nén theo thứ tự và tái tổ hợp thành phần tải. Một mẫu chứng minh khái niệm được xây dựng bằng kỹ thuật này đã không bị phát hiện bởi bất kỳ công cụ quét nào trên VirusTotal.

Một trình quét chỉ kiểm tra lớp dữ liệu hiển thị có thể bỏ sót phần dữ liệu độc hại được ẩn sâu hơn trong tệp. Đó chính là lý do tại sao mẫu tệp này đã vượt qua được mọi công cụ quét.

Stacked Pickle vượt qua các máy quét truyền thống

Safetensors loại bỏ hoàn toàn bộ máy thực thi

Safetensors lưu trữ các trọng số mô hình mà không cần đến bộ xử lý thực thi. Một tệp chứa một tiêu đề siêu dữ liệu gọn nhẹ mô tả hình dạng, kiểu dữ liệu và vị trí bắt đầu (offset) của từng tensor, tiếp theo là các byte thô của tensor. Nó không có luồng lệnh, máy ảo hay thành phần tương đương với hàm REDUCE của pickle, do đó trình tải không thể được chỉ định để gọi một hàm.

Một tệp Safetensors là dữ liệu không hoạt động mà trình tải sẽ đọc. Ngay cả một tệp được tạo ra với mục đích xấu cũng không thể thực thi mã khi được tải vì định dạng này không cung cấp bất kỳ đường dẫn nào để mã đó chạy.

So sánh cấu trúc tệp của Safetensors và Pickle

Tại sao Safetensors được ra đời, và tại sao nó lại lan rộng

Vấn đề với các định dạng cũ không bao giờ nằm ở chính các trọng số. Vấn đề là tệp đó còn có thể chứa các lệnh thực thi. Hugging Face, phối hợp với EleutherAI và Stability AI, đã phát triển Safetensors như một giải pháp thay thế được thiết kế chuyên biệt nhằm loại bỏ khả năng đó, đồng thời vẫn giữ nguyên những thông tin mà các nhóm phát triển cần từ tệp trọng số.

Safetensors cũng rất thiết thực. Công cụ này tải dữ liệu nhanh chóng nhờ cơ chế truy cập được ánh xạ vào bộ nhớ và không cần sao chép dữ liệu, hoạt động trên các khung công tác như PyTorch, TensorFlow, JAX và các khung công tác khác, đồng thời đã trở thành lựa chọn mặc định cho hầu hết các phiên bản mô hình mới. Những ưu điểm đó đã giúp công cụ này phổ biến rộng rãi mà không cần bất kỳ quy định bắt buộc nào.

Safetensors là một tiêu chuẩn an toàn hơn dành cho các tệp mô hình học máy

Một cuộc kiểm toán độc lập đã xác nhận tuyên bố về tính an toàn

Những người duy trì thư viện không phải là nguồn duy nhất đứng sau tuyên bố về tính an toàn này. Thư viện được viết bằng ngôn ngữ Rust, với trình biên dịch của ngôn ngữ này có khả năng ngăn chặn toàn bộ các loại lỗi phân tích cú pháp. Vào năm 2023, Hugging Face, EleutherAI và Stability AI đã cùng nhau ủy thác cho Trail of Bits thực hiện một cuộc kiểm toán độc lập về định dạng này.

Cuộc kiểm toán không phát hiện ra lỗ hổng nghiêm trọng nào có thể dẫn đến việc thực thi mã tùy ý. Cuộc kiểm toán đã chỉ ra một số điểm không chính xác trong đặc tả kỹ thuật và một bước xác thực bị thiếu, khiến các tệp đa ngôn ngữ được chấp nhận. Các nhà phát triển đã khắc phục và công bố tất cả các vấn đề này, sau đó thiết lập Safetensors làm mặc định.

Các dữ liệu ghi nhận kể từ đó đã chứng thực kết luận của cuộc kiểm toán. Các định dạng cũ đã gây ra các sự cố thực tế kể từ năm 2024, trong khi không có cuộc tấn công thực thi mã nào nhắm vào chính định dạng Safetensors được ghi nhận trong cùng khoảng thời gian đó. Safetensors không cung cấp cho kẻ tấn công bất kỳ cơ chế thực thi nào cho loại hình tấn công khiến các tệp dựa trên định dạng pickle trở nên nguy hiểm. Rủi ro còn lại xuất phát từ các định dạng cũ vẫn đang được sử dụng rộng rãi.

Mẫu xe " Supply Chain " vẫn cần một cửa kiểm tra

Rủi ro xuất phát từ việc định dạng tệp mô hình có thể chứa mã nguồn cùng với các tham số trọng số hay không. Các định dạng Pickle, PyTorch, TensorFlow và Keras có thể làm được điều này; trong khi đó, định dạng Safetensors thì không thể do thiết kế. Các chuyên gia bảo mật cần coi các định dạng mô hình có thể thực thi là một rủi ro, kiểm tra kỹ lưỡng mọi mô hình được đưa vào môi trường và hướng dẫn các nhóm ưu tiên sử dụng các định dạng an toàn bất cứ khi nào có thể.

Vẫn còn hàng triệu mô hình ở định dạng cũ trên các nền tảng chia sẻ công khai, và các nhóm nghiên cứu vẫn tiếp tục tải chúng về. Một kho lưu trữ cũng có thể phân phối một tệp dựa trên định dạng pickle cùng với một tệp an toàn, do đó việc có các trọng số Safetensors không đồng nghĩa với việc toàn bộ kho lưu trữ đó là an toàn. Chuỗi cung ứng mô hình sẽ cần có một cơ chế kiểm tra cho đến khi các định dạng cũ được loại bỏ hoàn toàn.

Trên thực tế, điều đó trở thành một danh sách kiểm tra ngắn gọn, có tỷ lệ dương tính giả thấp:

  • Nên ưu tiên sử dụng Safetensors và coi các định dạng cũ là cần phải kiểm tra trước khi sử dụng. Bất kỳ mô hình nào có định dạng .pt, .pth, .bin, .pkl, .pb hoặc .h5 từ nhà phát hành chưa được xác minh đều cần được quét trước khi tải vào.
  • Hãy coi việc tải mô hình ở định dạng cũ như một sự kiện thực thi. Việc tải mô hình dẫn đến việc khởi tạo một shell, mở kết nối ra ngoài từ trình thông dịch Python hoặc ghi dữ liệu vào một đường dẫn nhạy cảm là một tín hiệu hành vi cần được ghi nhận trong hệ thống thu thập dữ liệu từ máy chủ, giống như bất kỳ hoạt động thực thi mã nào khác.
  • Hãy quét toàn bộ tác phẩm, không chỉ tệp trọng số. Đơn vị phân tích là gói mô hình ở dạng được cung cấp, bởi vì định dạng của kho lưu trữ chỉ là một tuyên bố, chứ không phải là sự đảm bảo, cho đến khi có thứ gì đó xác minh nó

Cách quy trình xử lý năm lớp của Aether ( MetaDefender ) kiểm tra các tệp mô hình LLM

MetaDefender Aether™, giải pháp phát hiện lỗ hổng zero-day tích hợp của OPSWAT, mang lại hiệu quả phát hiện lỗ hổng zero-day lên tới 99,9% thông qua quy trình kiểm tra năm lớp. Mỗi tệp được gửi đến sẽ bắt đầu bằng quá trình phân tích loại tệp, nhằm xác định bản chất của tệp thay vì chỉ dựa vào phần mở rộng của nó. Mỗi lớp phân tích có thể đưa ra kết luận một cách độc lập. Ngay khi một lớp đạt được kết quả chắc chắn, quá trình phân tích sẽ dừng lại, nhờ đó phần lớn các tệp sẽ không phải trải qua các giai đoạn phân tích sâu hơn và tốn kém hơn.

  1. Đánh giá mức độ đe dọa. Giá trị băm của tệp và các chỉ số liên quan sẽ được đối chiếu với cơ sở dữ liệu thông tin tình báo về mối đe dọa toàn cầu tại OPSWAT, dựa trên hơn 50 tỷ chỉ số. Một giá trị băm đã được liên kết với một tệp độc hại đã biết sẽ bị chặn trong vòng chưa đầy một giây, và một tệp được xác nhận là an toàn cũng sẽ được thông qua nhanh chóng không kém, do đó chỉ có các tệp chưa được xác định mới được phép tiếp tục.
  2. Phân tích tĩnh. Trước khi bất kỳ mã nào được thực thi, tệp sẽ được Predictive Alin AI đánh giá song song với quá trình phân tích tĩnh và quét bằng công cụ chống vi-rút. Predictive Alin AI đưa ra kết luận dựa trên học máy chỉ trong vài mili giây mà không cần kích hoạt trong môi trường sandbox, được huấn luyện trên các bộ dữ liệu doanh nghiệp được chọn lọc kỹ lưỡng và đảm bảo quyền riêng tư, đồng thời liên tục được cải thiện thông qua vòng lặp huấn luyện lại zero-day được cấp dữ liệu từ các phát hiện đã được xác nhận củ MetaDefender Aether. Đối với các tệp mô hình, đây chính là giai đoạn mà một tệp pickle đáng ngờ chứa các mã lệnh payload có thể nhận diện được sẽ bị phát hiện trước khi bất kỳ thời gian mô phỏng nào được dành cho nó.
  3. Phân tích động. Công nghệ mô phỏng cấp lệnh giải quyết vấn đề “Stacked Pickle” bằng cách phơi bày hành vi của tệp mà không cần khởi động toàn bộ máy ảo cho mỗi mẫu. Công nghệ này vượt qua các cơ chế kiểm tra chống máy ảo và các độ trễ thời gian vốn thường được sử dụng để lách qua các hộp cát truyền thống, hoàn thành quá trình phân tích chỉ trong vài giây thay vì vài phút, với tốc độ nhanh gấp 20 lần và khả năng xử lý khối lượng dữ liệu lớn gấp 100 lần so với các công cụ hộp cát truyền thống.
  4. Chấm điểm mức độ đe dọa. Lớp này kết hợp các hàm được gọi, các kết nối đã cố gắng thiết lập, các tín hiệu danh tiếng và các phát hiện khác từ ba lớp đầu tiên. Lớp này dựa trên hơn 900 chỉ số hành vi để tạo ra một điểm số có thể hành động và một dấu vân tay tương đồng cho giai đoạn cuối cùng.
  5. Tìm kiếm mối đe dọa. Tính năng tìm kiếm độ tương đồng dựa trên học máy sẽ đối chiếu dấu vân tay với cơ sở dữ liệu thông tin tình báo về mối đe dọa của OPSWAT và các hành vi được lập bản đồ theo tiêu chuẩn MITRE để xác định các biến thể và chiến dịch. Một mô hình độc hại được đóng gói lại hoặc đổi tên có thể có giá trị băm mới, nhưng lớp này vẫn có thể phát hiện sự tương đồng của nó với một mô hình độc hại gốc đã biết.

Toàn bộ quy trình diễn ra tự động. Quy trình này đưa ra một kết luận tổng hợp và một báo cáo bằng chứng, trong đó liên kết từng chỉ số với hành vi đã tạo ra chỉ số đó.

MetaDefender Aether kiểm tra các tệp mô hình tại mọi điểm vào

Các mô hình được truyền tải qua các kênh tải xuống từ web, email, nền tảng chuyển tệp và các quy trình tự động. Một cổng kiểm tra phải bao quát mọi tuyến đường mà không bắt buộc các tổ chức phải thiết kế lại cơ sở hạ tầng truyền tải lưu lượng.

Đối với các kênh mạng, MetaDefender Aether tích hợp thông qua ICAP — giao thức tiêu chuẩn mà các máy chủ proxy, cổng email và nền tảng truyền tệp hiện đang sử dụng để chuyển tệp đến dịch vụ kiểm tra. Trong trường hợp lưu lượng truy cập không đi qua bất kỳ thiết bị mạng nào, có thể thực hiện phân tích tương tự thông qua giao diện REST API .

  • Tải xuống từ web. Khi một nhà phát triển tải xuống một mô hình từ Hugging Face hoặc Kaggle, máy chủ proxy hoặc cổng web bảo mật sẽ chuyển yêu cầu tải xuống đến MetaDefender Aether qua ICAP, và một tệp pickle độc hại sẽ bị chặn lại trước khi nó kịp tiếp cận điểm cuối.
  • Email. Các tệp mô hình và công cụ AI được chia sẻ dưới dạng tệp đính kèm sẽ được trích xuất và phân tích thông qua cùng một quy trình xử lý như bất kỳ tệp đính kèm nào khác, từ đó ngăn chặn lỗ hổng kỹ thuật xã hội nhằm lách các biện pháp kiểm soát ở cấp độ sổ đăng ký.
  • Truyền tệp. Các tệp được trao đổi với đối tác và nhà cung cấp, hoặc được chuyển giữa các vùng nội bộ thông qua hệ thống truyền tệp được quản lý, sẽ được quét trong quá trình truyền tải; do đó, ranh giới tin cậy vẫn được duy trì ngay cả đối với những tệp chưa bao giờ đi qua một trung tâm công cộng nào.
  • Các quy trình tự động và kho lưu trữ. Xây dựng các tác vụ và nền tảng học máy có khả năng lấy các mô hình một cách tự động, sau đó gửi chúng qua API trước khi bất kỳ thành phần nào được đưa lên kho lưu trữ nội bộ, từ đó bịt kín chính lỗ hổng mà các gói phần mềm Alibaba PyPI đã lợi dụng — trong đó quá trình giải quyết phụ thuộc sẽ tự động tải xuống và không ai có thể phát hiện ra tệp nào đáng ngờ.

Mỗi tuyến đường đều sử dụng cùng một quy trình kiểm tra và cùng một logic đưa ra kết luận, do đó không để lại bất kỳ kênh nào không được giám sát mà kẻ tấn công có thể lợi dụng.

Bảo mật mà không làm chậm tiến độ của các nhà phát triển

Các nhóm bảo mật thường bỏ qua rủi ro liên quan đến mô hình vì việc cấm tải xuống từ các hub công khai là không khả thi. MetaDefender Aether cho phép các nhà phát triển duy trì quy trình làm việc hiện tại trong khi hệ thống quét các mô hình ngay trong quy trình xử lý với tốc độ mô phỏng. Các lượt tải xuống bị chặn sẽ kèm theo báo cáo bằng chứng giải thích lý do.

Tìm hiểu cách Aether của MetaDefender kiểm tra các tệp mô hình LLM trước khi chúng vượt qua ranh giới tin cậy của bạn.

Những câu hỏi thường gặp

Bảo mật mô hình LLM là gì?
Bảo mật mô hình LLM là quy trình kiểm tra các tệp mô hình AI đã được huấn luyện sẵn để phát hiện mã độc được nhúng bên trong trước khi chúng được tải vào một môi trường. Quy trình này coi các mô hình được tải xuống từ các nền tảng công cộng như phần mềm có thể thực thi vượt qua ranh giới tin cậy, chứ không phải là dữ liệu vô hại.

Tại sao các tệp pickle lại nguy hiểm đối với các mô hình AI?
Khi tệp pickle được tải, máy ảo sẽ thực thi luồng lệnh trong tệp đó. Lệnh REDUCE cho phép kẻ tấn công gọi các hàm tùy ý trong quá trình này, do đó việc tải một mô hình dựa trên tệp pickle có thể khiến mã do kẻ tấn công kiểm soát được thực thi mà không có cảnh báo.

Safetensors là gì, và nó khác với pickle như thế nào?
Safetensors là một định dạng tệp chỉ chứa dữ liệu dùng để lưu trữ trọng số mô hình, bao gồm một tiêu đề siêu dữ liệu và các byte tensor thô, không có bộ máy thực thi và cũng không có lệnh nào tương đương với lệnh REDUCE của pickle. Trong khi tệp pickle là một chương trình mà trình tải (loader) thực thi, thì tệp Safetensors là dữ liệu tĩnh mà trình tải đọc.

Tệp Safetensors có thể vẫn chứa mã độc không?
Tệp Safetensors không thể thực thi mã khi được tải vì định dạng này không cung cấp đường dẫn thực thi. Tuy nhiên, một kho lưu trữ có thể chứa cả tệp dựa trên định dạng pickle cũ bên cạnh các trọng số Safetensors an toàn, do đó toàn bộ kho lưu trữ vẫn cần được kiểm tra.

MetaDefender Aether phát hiện các mô hình LLM độc hại như thế nào?
MetaDefender Aether kiểm tra các tệp mô hình qua năm lớp: danh tiếng mối đe dọa, phân tích tĩnh, phân tích động, chấm điểm mối đe dọa và săn lùng mối đe dọa. Hệ thống này chặn hầu hết các tệp trước khi chúng tiến vào các giai đoạn sâu hơn, tốn kém hơn và có thể phát hiện các tải trọng pickle xếp chồng lên nhau mà các trình quét một lớp truyền thống không thể phát hiện được.

Kiểm tra kỹ lưỡng mọi mô hình trước khi nó vượt qua ranh giới niềm tin của bạn

Hiện nay, các nhóm phát triển thường dựa vào các mô hình đã được huấn luyện sẵn và tái sử dụng, nhưng mỗi lần tải xuống từ một nguồn công khai đều đặt ra cùng một câu hỏi: tệp tin đó chỉ chứa dữ liệu hay còn có thể thực thi mã lệnh? MetaDefender Aether đưa ra câu trả lời trước khi mô hình được tải, bằng cách áp dụng năm lớp phân tích đối với các tệp tải xuống từ web, email, chuyển tệp và các quy trình tự động.

Luôn cập nhật với OPSWAT!

Đăng ký ngay hôm nay để nhận thông tin cập nhật mới nhất về doanh nghiệp, câu chuyện, thông tin sự kiện và nhiều thông tin khác.