Trích xuất dữ liệu hàng không có cấu trúc bằng Ollama và PGVector - Quy trình làm việc n8n

Tự động hóa việc trích xuất chính sách check-in online bằng quy trình làm việc (workflow) n8n nâng cao này. Cào dữ liệu trang web hãng hàng không, trích xuất JSON có cấu trúc thông qua LLM Ollama cục bộ, và lưu trữ dữ liệu vào Google Sheets và cơ sở dữ liệu vector Postgres (PGVector).

Xem trước Workflow

Sẵn sàng tự động hóa chưa?

Tải xuống mẫu quy trình làm việc n8n này và bắt đầu sử dụng ngay lập tức.

Đối tượng phù hợp


  • Các nhà phân tích dữ liệu và nhà nghiên cứu cần bộ dữ liệu lớn, có cấu trúc nhất quán về chính sách hàng không.

  • Các chuyên gia AI/ML xây dựng hệ thống RAG yêu cầu thông tin chất lượng cao, được vector hóa về hậu cần du lịch.

  • Các nhà phát triển tìm kiếm các mẫu (template) n8n nâng cao kết hợp cào web, AI cục bộ (Ollama) và lưu trữ cơ sở dữ liệu vector.

  • Người dùng muốn triển khai khả năng kiểm soát luồng logic lõi phức tạp trong một workflow n8n.

Tổng quan

Việc duy trì thông tin cập nhật, có cấu trúc về các chính sách hàng không đa dạng—như thời hạn check-in online, quy định hành lý và quy tắc hoàn tiền—là một thách thức dữ liệu đáng kể. Workflow n8n nâng cao này giải quyết vấn đề đó bằng cách tự động hóa hoàn toàn đường ống dữ liệu (data pipeline).

Workflow n8n tận dụng các kỹ thuật cào web (thông qua Jina AI Reader) để xử lý các trang web phức tạp của hãng hàng không, sau đó sử dụng LLM cục bộ mạnh mẽ (được host qua node n8n Ollama) để biến đổi văn bản thô, phi cấu trúc thành các đối tượng JSON sạch sẽ, nhất quán. Dữ liệu có cấu trúc này ngay lập tức có giá trị để báo cáo (Google Sheets) và cũng được chuyển đổi thành vector nhúng và lập chỉ mục vào cơ sở dữ liệu PGVector, cho phép các khả năng tìm kiếm ngữ nghĩa tinh vi để xây dựng cơ sở tri thức AI riêng. Mẫu n8n tinh vi này thể hiện sự tích hợp liền mạch giữa các công cụ dữ liệu cổ điển và cơ sở hạ tầng AI hiện đại.

Cách thức hoạt động

Workflow n8n mạnh mẽ này hoạt động tuần tự, xử lý từng mục URL hãng hàng không được lấy từ bảng tính nguồn:


  1. Kích hoạt và Khởi tạo: Quá trình bắt đầu bằng Chat Trigger, khởi tạo việc truy xuất các URL mục tiêu. Node n8n Fetch Airline URLs đọc danh sách các URL hãng hàng không và chi tiết tương ứng đã được xác định trước từ Google Sheet.

  2. Xử lý Mục: Workflow sử dụng node n8n Loop Over Items để xử lý từng URL hãng hàng không riêng lẻ, đảm bảo khả năng xử lý mạnh mẽ và kiểm soát luồng.

  3. Truy xuất Dữ liệu (Cào): Node n8n Scrape Airline Webpage sử dụng HTTP Request để lấy nội dung. Nó chuyển hướng URL gốc qua dịch vụ đọc Jina AI (https://r.jina.ai/) để nhận phiên bản văn bản trang web sạch sẽ, dễ đọc, rất quan trọng cho việc phân tích LLM chính xác. Node n8n này cũng xử lý xác thực tiêu đề (header) và truyền cookie cần thiết.

  4. Trích xuất bằng AI: Node n8n Extract Info with LLM thực hiện biến đổi dữ liệu cốt lõi. Nó chuyển văn bản trang web thô vào một prompt hướng dẫn nghiêm ngặt, yêu cầu đầu ra phải là một lược đồ JSON cụ thể bao gồm các chính sách check-in online, hành lý và hoàn tiền. Hoạt động LLM được cung cấp bởi node n8n Chat Model được cấu hình để sử dụng Ollama.

  5. Lưu trữ (Google Sheets): Node Wait for Response đảm bảo đồng bộ hóa, và node n8n Store Extracted Info cập nhật Google Sheet gốc bằng cách sử dụng row_number. Nó lưu đầu ra JSON có cấu trúc, sạch sẽ do LLM cung cấp.

  6. Vector hóa: Workflow sau đó chuẩn bị văn bản đã trích xuất để lập chỉ mục ngữ nghĩa. Dữ liệu đi qua node Prepare Text for Vector DB, node Split Long Text (Token Splitter) để phân đoạn, và node Generate Embeddings, sử dụng Ollama để tạo các biểu diễn vector.

  7. Chèn vào DB Vector: Cuối cùng, node n8n Save to Vector DB chèn các tài liệu đã được vector hóa này vào Cơ sở dữ liệu Vector PostgreSQL (PGVector).

  8. Kiểm soát Luồng (Trễ): Node n8n Wait Before Next Batch đưa ra một khoảng dừng ngắn (15 giây) trước khi Loop Over Items chuyển sang hãng hàng không tiếp theo, nhằm ngăn chặn sự cố giới hạn tốc độ (rate limit) và đảm bảo sự ổn định của workflow n8n tự động này.

Hướng dẫn cài đặt

Để thiết lập workflow n8n nâng cao này, hãy làm theo các bước sau:


  1. Nhập workflow n8n: Sao chép dữ liệu JSON được cung cấp và dán vào phiên bản n8n của bạn bằng cách sử dụng chức năng 'New' -> 'Import from JSON'.

  2. Thiết lập Thông tin xác thực (Credentials):

Google Sheets: Cung cấp thông tin xác thực cho tài khoản Google Sheets- test được sử dụng trong các node n8n Fetch Airline URLs và Store Extracted Info. Đảm bảo tài khoản dịch vụ có quyền đọc/ghi vào bảng tính nguồn của bạn.
Ollama: Cấu hình thông tin xác thực Ollama - test cho các node n8n Chat Model và Generate Embeddings. Điều này yêu cầu máy chủ Ollama của bạn phải truy cập được từ cài đặt n8n của bạn.
Postgres: Cấu hình thông tin xác thực Postgres-test cho node n8n Save to Vector DB, đảm bảo cơ sở dữ liệu đang chạy và tiện ích mở rộng PGVector đã được cài đặt.
Xác thực Header HTTP: Cung cấp thông tin xác thực cho tài khoản Header Auth account được sử dụng trong node n8n Scrape Airline Webpage, cần thiết nếu URL cào (Jina AI) yêu cầu cookie hoặc tiêu đề phức tạp.

  1. Tùy chỉnh Nguồn Dữ liệu: Cập nhật node n8n Fetch Airline URLs để trỏ đến ID Tài liệu Google Sheet và Tên Sheet cụ thể của bạn chứa danh sách các URL hãng hàng không.

  2. Kích hoạt và Thực thi: Sau khi tất cả thông tin xác thực đã được đặt và nguồn dữ liệu đã được cấu hình, hãy kích hoạt trigger n8n và chạy workflow n8n.

Chi tiết Node

Chat Trigger - Start (n8n trigger): Khởi tạo việc thực thi workflow n8n.
Fetch Airline URLs (node n8n Google Sheets): Đọc dữ liệu đầu vào (danh sách các hãng hàng không và URL check-in của họ) từ một Google Sheet được chỉ định, sử dụng xác thực Tài khoản Dịch vụ (Service Account).
Loop Over Items (node n8n Split In Batches): Đảm bảo rằng mỗi hàng (mục hãng hàng không) từ Google Sheet được xử lý tuần tự, điều này rất quan trọng cho việc cào web và xử lý LLM có kiểm soát.
Scrape Airline Webpage (node n8n HTTP Request): Thực hiện việc truy xuất dữ liệu thực tế. Nó xây dựng động URL Jina AI bằng cách sử dụng trường 'WEB CHECK IN URL' của mục để cào nội dung văn bản sạch. Node n8n này cũng xử lý xác thực tiêu đề và truyền cookie cần thiết.
Extract Info with LLM (node n8n Chain LLM): Trí tuệ cốt lõi của workflow n8n này. Nó áp dụng một prompt chi tiết, có cấu trúc vào văn bản thô đã cào, buộc LLM phải xuất ra một đối tượng JSON tiêu chuẩn hóa.
Chat Model / Generate Embeddings (node n8n Ollama): Các node này kết nối workflow n8n với một phiên bản Ollama tự host, cung cấp cả việc xử lý mô hình ngôn ngữ lớn để trích xuất và mô hình nhúng để tạo vector.
Store Extracted Info (node n8n Google Sheets): Cập nhật hàng bảng tính gốc bằng cách sử dụng row_number, chèn dữ liệu JSON có cấu trúc đã tạo. Đây là một node n8n quan trọng để theo dõi nguồn gốc dữ liệu.
Save to Vector DB (node n8n PGVector): Nhận các tài liệu và vector nhúng đã xử lý và chèn chúng vào cơ sở dữ liệu vector PostgreSQL, sẵn sàng cho các truy vấn RAG nâng cao. Điều này thể hiện khả năng lưu trữ dữ liệu mạnh mẽ trong workflow n8n này.

Các quy trình n8n liên quan

miễn phí

Node: 12 Node
Đã cập nhật: Tháng 12 26 2025
Xem tất cả
Tạo bởi

The AI Squad Initiative is a pioneering effort to build, automate and scale AI-powered workflows using n8n.io. Our mission is to help individuals and businesses integrate AI agents seamlessly into their daily operations from automating tasks and enhancing productivity to creating innovative, intelligent solutions. We design modular, reusable AI workflow templates that empower creators, developers and teams to supercharge their automation with minimal effort and maximum impact.

Đặc sắc*