← Tất cả bài viết
17.07.2026

Article Extractor: Trích xuất và tổng hợp nội dung bài viết.

Article Extractor: Trích xuất và tổng hợp nội dung bài viết.
Nguyễn Ngọc Hải 7 phút đọc

Vì sao cần skill này

Đọc một bài báo hay bài blog trên web ngày nay là một trải nghiệm đầy nhiễu: quảng cáo chen ngang, pop-up mời đăng ký nhận tin, menu điều hướng, banner cookie, các khối "bài viết liên quan", nút chia sẻ mạng xã hội… Phần nội dung thực sự cần đọc chỉ chiếm một góc nhỏ giữa vô số thứ gây xao nhãng.

Việc này không chỉ khó chịu khi đọc, mà còn phiền khi bạn muốn lưu lại một bài viết. Copy thủ công thì dính đủ thứ rác; lưu cả trang thì nặng và lộn xộn; in ra PDF thì vẫn còn quảng cáo.

Article Extractor sinh ra để giải quyết đúng việc đó: bạn đưa một đường link, skill sẽ tự tải về và bóc tách phần nội dung chính của bài viết — bỏ hết quảng cáo, menu, form đăng ký, phần bình luận — rồi lưu thành một file text sạch, dễ đọc, đặt tên theo đúng tiêu đề bài. Nói ngắn gọn: nó biến một trang web hỗn độn thành một tài liệu văn bản gọn gàng chỉ trong một bước.

Skill này làm được gì

Khi nhận một đường link, skill thực hiện quy trình sau:

1. Tự chọn công cụ tốt nhất đang có. Skill kiểm tra và dùng công cụ theo thứ tự ưu tiên:

  • reader (dựa trên thuật toán Readability của Mozilla — chính là cơ chế đằng sau "Chế độ đọc" của Firefox) — tốt cho hầu hết bài báo, blog.
  • trafilatura (công cụ Python) — rất chính xác với tin tức, blog cấu trúc phức tạp, và hỗ trợ nhiều ngôn ngữ (kể cả tiếng Việt).
  • Phương án dự phòng (tải trực tiếp + bóc tách cơ bản) — kém chính xác hơn nhưng chạy được khi máy chưa cài công cụ nào.

2. Bóc tách nội dung sạch. Giữ lại tiêu đề, các đề mục, và toàn bộ phần thân bài. Loại bỏ: menu điều hướng, quảng cáo, form đăng ký nhận tin, sidebar bài liên quan, phần bình luận, nút mạng xã hội, thông báo cookie.

3. Tự đặt tên file theo tiêu đề bài và làm sạch tên cho hợp lệ với hệ thống file (bỏ các ký tự đặc biệt, giới hạn độ dài).

4. Lưu file và hiển thị bản xem trước vài dòng đầu để bạn kiểm tra kết quả có đúng không.

Kết quả: một file .txt chỉ chứa nội dung bài viết — sẵn sàng để đọc offline, lưu trữ, hoặc đưa tiếp cho Claude phân tích/tóm tắt.

Giải quyết vấn đề gì — ví dụ thực tế ở VNPAY

Với một công ty thanh toán hoạt động trong ngành chịu quản lý chặt, một tình huống rất hay gặp: theo dõi thay đổi pháp lý. Ngân hàng Nhà nước ra một thông tư mới, Chính phủ ban hành một nghị định liên quan đến trung gian thanh toán, ví điện tử, bảo vệ dữ liệu cá nhân — và tin tức về nó xuất hiện rải rác trên các báo. Thay vì copy thủ công từng bài dính đầy quảng cáo, bạn có thể:

  • Đưa link bài báo về thông tư/nghị định → skill bóc sạch nội dung → lưu thành file text.
  • Gom nhiều bài về cùng một chủ đề thành một bộ tài liệu gọn để đọc và đối chiếu.
  • Đưa file text đó cho Claude tóm tắt các điểm chính, hoặc so sánh nội dung nhiều bài.

Ngoài theo dõi pháp lý, skill hữu ích cho nhiều tình huống khác:

  • Lưu lại bài hướng dẫn kỹ thuật, tutorial để tra cứu offline, không lo trang gốc bị xoá.
  • Thu thập tài liệu tham khảo cho một dự án hoặc bài nghiên cứu nội bộ.
  • Chuẩn bị nguồn trước khi nhờ Claude phân tích — text sạch cho kết quả phân tích tốt hơn nhiều so với dán cả trang web hỗn độn.
⚠️ Một lưu ý quan trọng về nội dung pháp lý: báo chí chỉ đưa tin về thông tư, nghị định — có thể diễn giải chưa đầy đủ hoặc chưa chính xác. Với các quyết định có tính tuân thủ, luôn đối chiếu lại với văn bản gốc trên cổng thông tin chính thức (Chính phủ, Ngân hàng Nhà nước, công báo). Skill này giúp bạn thu thập và đọc nhanh, không thay thế văn bản pháp quy chính thức.

Dành cho ai ở VNPAY

  • Performance & Transformation, và các bộ phận theo dõi pháp lý/tuân thủ: thu thập nhanh tin tức về quy định mới để tổng hợp, báo cáo.
  • Project Manager: lưu lại tài liệu tham khảo, bài hướng dẫn công cụ, best practices cho dự án.
  • Bất kỳ ai hay đọc và lưu bài trên web: muốn một bản text sạch để đọc tập trung hoặc lưu trữ lâu dài.

Đặc biệt hợp với người thường xuyên phải đọc nhiều, tổng hợp từ nhiều nguồn — skill cắt bỏ toàn bộ thao tác dọn dẹp thủ công.

Điều kiện để dùng

  • Skill này chạy lệnh trên máy (dùng công cụ dòng lệnh như reader/trafilatura và tải nội dung từ web), nên cần môi trường có quyền chạy lệnh (Bash) và ghi file (Write) — ví dụ Claude Desktop có bật code execution, hoặc Claude Code.
  • Cần gói Claude trả phí (Pro, Max, Team hoặc Enterprise) hỗ trợ Skills và code execution.
  • Lần chạy đầu, nếu máy chưa có công cụ, skill có thể cần cài trafilatura (qua pip) hoặc reader (qua npm). Nếu không cài được, skill tự chuyển sang phương án dự phòng.

Hướng dẫn upload skill lên Claude Desktop

Sau khi tải file skill về, làm theo 3 bước:

Bước 1 — Mở Customize. Trong giao diện Claude Desktop, bấm "Customize"góc trên bên trái.

Bước 2 — Mở menu Add. Trong màn hình Customize, bấm vào dropdown của phần "Add"góc trên bên phải.

Bước 3 — Upload skill. Chọn "Upload skill", rồi trỏ tới file skill của bạn.

Lưu ý về định dạng file: skill cần ở dạng thư mục chứa SKILL.md (và các file kèm theo nếu có). Nếu tải về từ site nội bộ dưới dạng .zip, cứ upload file .zip đó — bên trong đã là đúng cấu trúc skill.

Upload xong, skill nằm sẵn trong danh sách kỹ năng và Claude tự biết khi nào cần gọi.

Các cách gọi skill lên

1. Để Claude tự nhận diện (khuyên dùng). Chỉ cần đưa đường link kèm một yêu cầu tự nhiên, Claude sẽ khớp với mô tả skill và tự gọi:

"Trích nội dung bài này giúp tôi: https://…"

"Lưu bài blog ở link này thành file text."

"Bóc nội dung bài báo về thông tư mới này, bỏ hết quảng cáo."

2. Gọi đích danh skill khi muốn chắc chắn:

"Dùng skill article-extractor để trích bài viết ở link này."

3. Đưa nhiều link cùng lúc để gom tài liệu:

"Trích nội dung của 3 link này và lưu mỗi bài một file."

Sau khi trích xong, skill hiển thị tiêu đề bài, đường dẫn file đã lưu, và vài dòng xem trước để bạn kiểm tra.

Lưu ý bảo mật cho môi trường VNPAY

  • Skill tải nội dung từ đường link bạn cung cấp. Chỉ đưa các link công khai, đáng tin cậy; cẩn trọng với link lạ.
  • Skill không vượt qua được tường phí (paywall) hay trang yêu cầu đăng nhập — với các trang đó, nó sẽ báo không trích được. Đừng tìm cách đưa thông tin đăng nhập vào skill.
  • Với nội dung pháp lý/tuân thủ, luôn đối chiếu lại văn bản gốc chính thức (xem lưu ý ở trên).
  • File skill tải về từ nguồn ngoài (GitHub) là mã của bên thứ ba — nên đọc qua SKILL.md để biết nó chạy những lệnh gì trước khi dùng cho công việc.

Tóm lại

Article Extractor là một trợ thủ nhỏ nhưng dùng rất thường xuyên: biến bất kỳ đường link nào thành một file text sạch, chỉ còn nội dung cần đọc. Với công việc phải theo dõi tin tức, tổng hợp tài liệu, hay chuẩn bị nguồn cho phân tích — đặc biệt là theo dõi thay đổi pháp lý ở một công ty fintech như VNPAY — nó tiết kiệm rất nhiều thao tác dọn dẹp thủ công. Cài một lần, dùng cho mọi bài viết về sau.


Download file:


References

  1. Anthropic Agent Skills — Claude Platform Docs. Available at: https://platform.claude.com/docs/en/agents-and-tools/agent-skills/overview (Accessed: 17/07/2026).
  2. Mozilla Readability. Available at: https://github.com/mozilla/readability (Accessed: 17/07/2026).
  3. trafilatura — Python web scraping & text extraction. Available at: https://trafilatura.readthedocs.io (Accessed: 17/07/2026).
  4. Skill nguồn: article-extractor (tải từ GitHub).