Khi bạn dán một đoạn Claude hoặc ChatGPT vừa viết vào Google Sheet và cột tự nhiên lệch, hoặc tìm kiếm trong Confluence mà không ra đúng cụm từ bạn đang nhìn thấy trên màn hình, rất có thể nguyên nhân không nằm ở bạn. Nội dung do AI sinh ra thường mang theo những thứ mắt thường không nhìn thấy.
Có ba loại dấu vết như vậy, nằm ở ba tầng khác nhau. Remove AI Marks là một skill cho Claude Code, được tác giả guillaumemeyer công bố trên AugmentClaude và mã nguồn mở trên GitHub, làm đúng một việc: rà và dọn cả ba tầng đó [1][2].
Bài này viết cho người chưa từng cài skill nào. Nó đi từ nguyên lý, tới cài đặt, tới cách dùng, và kết bằng phần quan trọng nhất là những gì công cụ này không làm được cùng những rủi ro phải cân nhắc trước khi đưa vào công việc thật.
[ẢNH: ảnh bìa minh hoạ chủ đề dấu vết số và siêu dữ liệu, xem ghi chú biên tập]
Bốn khái niệm nền cần nắm trước khi thao tác
Phần này quyết định bạn dùng công cụ đúng chỗ hay dùng sai chỗ. Bỏ qua nó thì các bước sau chỉ là gõ lệnh theo mẫu.
Ba tầng dấu vết nằm ở ba nơi khác nhau
Tầng A, ký tự Unicode vô hình. Đây là các ký tự có thật trong chuỗi văn bản nhưng không hiển thị thành hình: khoảng trắng đặc biệt, ký tự nối không ngắt, ký tự điều khiển hướng viết. Chúng đi kèm nội dung khi bạn copy và paste. Đây là tầng dễ dọn nhất vì việc dọn mang tính xác định: đếm được bao nhiêu ký tự đã bị gỡ.
Tầng B, watermark thống kê trong cách chọn từ. Tầng này tinh vi hơn nhiều. Google DeepMind mô tả cơ chế SynthID cho văn bản như sau: mô hình ngôn ngữ sinh chữ theo thứ tự, mỗi từ được gán một điểm xác suất về khả năng nó là từ tiếp theo, và SynthID điều chỉnh chính các điểm số đó để nhúng một dấu hiệu không nhận biết được mà không làm giảm chất lượng đầu ra [3]. Nói cách khác, dấu vết không nằm ở ký tự nào cả, nó nằm ở thói quen chọn từ trên toàn đoạn. Không thể xoá bằng cách tìm và thay thế. Cách duy nhất để làm loãng nó là viết lại.
Tầng metadata trong file. Ảnh, PDF, DOCX đều mang theo các khối thông tin mô tả: EXIF, XMP, và gần đây là C2PA. C2PA là chuẩn kỹ thuật mở cho phép người tạo và người xem xác định nguồn gốc cùng lịch sử chỉnh sửa của một nội dung số, được ví như "nhãn dinh dưỡng cho nội dung số", với ban điều hành gồm Adobe, Amazon, BBC, Google, Meta, Microsoft, OpenAI, Sony và TikTok [4]. Đây là lý do một ảnh do AI tạo có thể tự khai báo mình do AI tạo, kể cả khi bạn không nói gì.
Skill này không tự dọn, nó gọi một dịch vụ khác dọn
Đây là điểm kiến trúc quan trọng nhất và cũng là điểm nhiều người bỏ qua khi đọc lướt. Tài liệu skill nói thẳng: đây là một thin client, toàn bộ máy móc xử lý chạy trong một HTTP service riêng, và agent tuyệt đối không được tự chạy script dọn ở máy mình [1].
Hệ quả thực tế: cài skill xong vẫn chưa dùng được. Bạn phải có service chạy ở một địa chỉ, mặc định là http://127.0.0.1:8765, và skill giao tiếp với nó qua curl. Nếu service không phản hồi, skill được yêu cầu dừng lại và báo lỗi, chứ không được tự xoay xở dọn tại chỗ [1].
Đây thực ra là một thiết kế tốt: máy bạn không cần cài Python, không cần môi trường ảo, không cần bộ công cụ xử lý ảnh. Nhưng nó cũng có nghĩa là mọi file bạn nhờ dọn đều đi qua một dịch vụ. Xem lại điểm này ở mục rủi ro.
Dọn được không đồng nghĩa với không bị phát hiện
Tác giả skill nói rất rõ điều này, và đây là chỗ khác biệt giữa một công cụ nghiêm túc với các trang quảng cáo "làm AI content thành 100% human". Báo cáo trả về được yêu cầu tách bạch hai loại kết quả: cái gì đã gỡ được và kiểm chứng được (đếm số ký tự, liệt kê thao tác trên metadata), và cái gì chỉ là nỗ lực tốt nhất không xác nhận được (tầng B) [1].
Tài liệu repo còn nói thêm rằng công cụ không thể chứng nhận là các bộ dò của nhà cung cấp sẽ thất bại, và khuyến cáo người dùng tự đối chiếu bằng công cụ của chính nhà cung cấp thay vì tin công cụ này là thẩm quyền cuối cùng [2].
Mức rủi ro còn lại cũng được nêu theo hướng ngược với trực giác thông thường: văn bản ngắn và dễ đoán thì rủi ro còn lại thấp, còn văn bản dài và nhiều thông tin thì rủi ro còn lại cao hơn [1].
Ranh giới đạo đức do chính tác giả đặt ra
Mục Ethics của skill viết ngắn nhưng dứt khoát: công cụ dành cho nội dung của chính bạn, phục vụ quyền riêng tư, vệ sinh dữ liệu và nghiên cứu. Không được quảng bá kết quả là "bằng chứng do người viết". Nếu người dùng rõ ràng muốn gian lận học thuật hoặc che giấu trái pháp luật, skill được yêu cầu cảnh báo và chỉ thực hiện phần dọn kỹ thuật trên nội dung mà người đó sở hữu [1].
Bài viết này giữ nguyên tinh thần đó. Với môi trường VNPAY, câu hỏi đúng không phải "làm sao để bài viết không bị chấm là AI", mà là "làm sao để nội dung và file mình gửi đi không mang theo thứ mình không muốn gửi".
Bước 1: Cài skill vào máy
Điều kiện trước
Skill nạp từ thư mục ~/.claude/skills/ khi Claude Code khởi động, nên bạn cần có Claude Code trên máy trước [5]. Nếu chưa có, cài một lần bằng lệnh sau rồi gõ claude trong terminal để kiểm tra [1]:
npm i -g @anthropic-ai/claude-codeCài skill
Dán lệnh dưới đây vào Claude Code hoặc vào thẳng terminal. Lệnh này clone repo về thư mục tạm rồi copy toàn bộ thư mục skill vào đúng chỗ [1]:
git clone https://github.com/guillaumemeyer/watermarks-remover.git /tmp/guillaumemeyer__watermarks-remover && mkdir -p ~/.claude/skills/remove-ai-marks-guillaumemeyer && cp -r /tmp/guillaumemeyer__watermarks-remover/skills/remove-ai-marks/. ~/.claude/skills/remove-ai-marks-guillaumemeyer/Cách này copy cả thư mục, gồm file SKILL.md cùng mọi script, tài liệu tham chiếu và template mà skill mang theo. Đây là cách an toàn mặc định, đúng cho mọi skill [1].
Khởi động lại và gọi skill
Thoát và mở lại Claude Code. Skill mới chỉ được nạp lúc khởi động [1].
Sau đó không cần gõ lệnh gì đặc biệt. Skill tự kích hoạt khi yêu cầu của bạn khớp với phần mô tả của nó, ví dụ khi bạn nói muốn gỡ ký tự ẩn, dọn metadata AI, hay xoá C2PA. Nếu muốn gọi thẳng thì dùng /remove-ai-marks, cũng chấp nhận bí danh /remove-claude-marks [1].
Một lựa chọn nhẹ hơn nhiều cho người không rành kỹ thuật
Repo gốc thực ra chứa hai skill, không phải một [2]:
remove-ai-marks: bản đầy đủ, cần service HTTP chạy kèm, xử lý được cả file và ảnh.clean-user-facing-text: bản chỉ xử lý văn bản, tự chứa, không cần service.
Cả hai được cài qua script install_skill.py trong repo, chỉ định tên skill và nền tảng đích, và đều dùng được với Claude Code, Cursor cùng một số agent khác [2].
Nếu nhu cầu của bạn chỉ là dọn ký tự ẩn trong đoạn text trước khi dán vào Jira hay Google Sheet, bản thứ hai là lựa chọn hợp lý hơn hẳn: không phải dựng gì thêm, không phải đưa file đi đâu cả. Đây là khuyến nghị thực tế cho phần lớn người đọc bài này.
Bước 2: Dựng service xử lý
Với bản đầy đủ, bạn cần một service đang chạy. Có ba đường [2]:
| Cách | Lệnh | Phù hợp khi |
|---|---|---|
| Chạy cục bộ, nhẹ nhất | make serve | Chỉ cần Python 3.10 trở lên, không cần cài thư viện ngoài cho phần lõi |
| Docker Compose | docker compose up -d | Cần đủ bộ công cụ xử lý file |
| Ảnh dựng sẵn | Image trên GHCR của tác giả | Muốn có sẵn exiftool, qpdf, c2patool |
Sau khi service chạy, việc đầu tiên skill làm là kiểm tra sức khoẻ [1]:
WM="${WATERMARKS_SERVICE_URL:-http://127.0.0.1:8765}"
curl -sf "$WM/health"Nếu service có đặt khoá, mọi request phải kèm header Authorization: Bearer ... [1].
Kiểm tra service làm được gì trước khi hứa
Đây là thói quen đáng học nhất trong toàn bộ thiết kế của skill này. Trước khi tư vấn cho người dùng, skill phải gọi /capabilities để xem thực tế service đang có những công cụ nào: c2patool, exiftool, qpdf, ghostscript, các bộ chấm điểm, các bộ dò watermark văn bản, và các backend nặng cho xử lý ảnh [1].
Nguyên tắc kèm theo: chỉ được khuyến nghị xoá watermark ở tầng điểm ảnh, chấm điểm SynthID hay dò theo nhà cung cấp khi service báo có backend tương ứng [1]. Nói cách khác, không hứa thứ mình không kiểm tra được.
Bước 3: Soi trước, dọn sau
Skill có ba đầu API chính, tất cả nhận JSON với file mã hoá base64 [1]:
| Method | Đường dẫn | Trả về |
|---|---|---|
| GET | /health | Service có sống không |
| GET | /capabilities | Công cụ và backend nào đang có |
| GET | /openapi.json | Bản mô tả API chuẩn OpenAPI 3.0.3 |
| POST | /inspect | Loại file, có đáng ngờ không, báo cáo chi tiết |
| POST | /detect | Kết quả dò watermark |
| POST | /clean | File đã dọn dạng base64, kèm báo cáo |
Quy trình chuẩn là soi trước rồi mới quyết định, không đoán. Lệnh /inspect trả về danh sách điểm mã đáng ngờ, cờ C2PA hoặc cờ AI, kèm nhãn mức độ tin cậy theo bốn bậc: đã xác nhận, nhiều khả năng, mang tính thông tin, và nhiều khả năng báo nhầm [1].
Việc định tuyến dựa vào phần mở rộng của tên file trước, rồi mới tới các byte đầu file. Vì vậy khi bạn dán một đoạn text và nhờ dọn, cần đặt tên file tạm có đuôi rõ ràng như .txt hoặc .md [1].
Định dạng nào đi đường nào
| Đầu vào | Cách xử lý |
|---|---|
| Text dán trực tiếp | Tạo file tạm rồi soi và dọn theo luồng văn bản |
.txt, file mã nguồn | Tầng A, kèm formatter với mã nguồn |
.md, .html | Dọn phần container (frontmatter, thẻ meta) và tầng A. Tầng B phải áp riêng cho phần văn xuôi |
.png, .jpg, .webp, .avif, .heic, .bmp, .gif, .tiff | Gỡ metadata ảnh |
.svg, .pdf, .docx, .epub, .odt | Gỡ metadata container |
| Cả thư mục hoặc website | Chạy công cụ audit tổng hợp |
Nguồn: bảng phân loại đầu vào trong tài liệu skill [1].
Bước 4: Dọn và đọc báo cáo
Lệnh dọn dùng chung cho mọi loại file, service tự nhận diện [1]:
curl -s -X POST "$WM/clean" -H 'Content-Type: application/json' \
-d "{\"file\": \"$(base64 < notes.md | tr -d '\n')\", \"name\": \"notes.md\"}"Kết quả trả về ở trường cleaned dạng base64, agent tự giải mã và ghi ra file. Mặc định ghi ra file mới có đuôi *.cleaned.*, chỉ ghi đè lên file gốc khi người dùng yêu cầu rõ ràng [1]. Đây là mặc định đúng, nên giữ nguyên.
Một số tuỳ chọn đáng biết của /clean [1]:
nfkcvàaggressive_homoglyphs: mức chuẩn hoá ký tự cho văn bảnkeep_non_ai_metadatavàstrip_all_metadata: giữ lại hay xoá sạch mọi metadatadeep_images: với PDF, quyết định truy metadata nằm trong ảnh nhúng tới mức nào, nhận bốn giá trịauto,always,lossless,never, giá trị lạ bị báo lỗi chứ không tự chuyển về mặc địnhdetect_beforevàdetect_after: chạy dò watermark trước và sau khi dọn, đưa kết quả vào báo cáo
Với PDF, cần lưu ý rõ: bản dọn chỉ là nỗ lực tốt nhất nếu thiếu exiftool, và không đầy đủ nếu thiếu qpdf ở phía máy chủ. Trường hợp metadata nằm trong ảnh nhúng (bản scan, file xuất từ Photoshop) thì còn cần thêm ghostscript [1].
Báo cáo phải nói đủ năm điều
Tài liệu skill quy định báo cáo cuối cùng luôn phải nêu [1]:
- Tầng A và phần container đã gỡ được cái gì, đếm cụ thể
- Tầng B đã làm gì, nói rõ đây là nỗ lực thống kê, không được tuyên bố "không thể phát hiện"
- Những thứ nằm ngoài phạm vi
- Cảnh báo rằng công cụ của nhà cung cấp vẫn có thể phát hiện được sau khi đã dọn
- Một dòng nhắc về đạo đức sử dụng
Đây là chuẩn báo cáo đáng để phòng mình học lại cho các công việc khác: tách bạch cái đã kiểm chứng với cái chỉ là ước lượng.
Bước 5: Tầng B và vì sao nên cân nhắc kỹ
Tầng B là bước viết lại văn bản nhằm làm loãng dấu vết thống kê. Skill quy định luôn đề xuất bước này cho nội dung ngôn ngữ tự nhiên, không được bỏ qua trong im lặng [1].
Cách làm gồm nhiều lượt: dọn tầng A, viết lại theo một chiến lược, có thể thêm một lượt mạnh hơn, rồi dọn tầng A một lần nữa trên kết quả. Chiến lược viết lại được mô tả dạng danh sách có thứ tự kèm cường độ, ví dụ diễn đạt lại ở mức cao rồi thay từ ở mức thấp, và có thể ghi đè qua tuỳ chọn strategy [1]. Skill có sẵn bốn hướng viết lại: diễn đạt lại giữ nguyên nghĩa, viết lại cho tự nhiên hơn, dịch vòng qua một ngôn ngữ khác rồi dịch ngược, và rút thành dàn ý rồi viết lại từ dàn ý [1].
Một chi tiết kỹ thuật đáng chú ý: skill khuyến nghị dùng mô hình khác với mô hình nghi là nguồn gốc để viết lại, vì nếu dùng lại đúng mô hình đó thì nhiều khả năng bạn chỉ đóng dấu mới lên nội dung [1][2].
Nhưng đây cũng là bước có cái giá thật. Chính tài liệu repo thừa nhận việc viết lại làm phẳng giọng văn, làm mất sắc thái và làm giảm độ chính xác, và đặt thẳng câu hỏi: nếu cuối cùng vẫn đưa văn bản qua một mô hình rẻ hơn để viết lại, thì trả tiền cho mô hình tốt ngay từ đầu để làm gì [2].
Với tài liệu nghiệp vụ của phòng, đây là lý do đủ mạnh để không dùng tầng B cho PRD, URD, báo cáo tiến độ hay bất cứ văn bản nào mà con số, tên hệ thống và thuật ngữ phải chính xác tuyệt đối. Rủi ro sai lệch một tham số trong tài liệu thanh toán lớn hơn nhiều so với lợi ích của việc làm loãng một dấu vết thống kê.
Bước 6: Rà soát cả thư mục hoặc cả website
Khi cần kiểm tra một thư mục tài liệu hoặc một website thay vì từng file, skill dùng các công cụ audit đi kèm trong image của service, chạy dưới dạng container một lần rồi thoát [1].
Phần đáng nhớ nhất ở đây là bảng mã thoát, vì nó quyết định bạn hiểu kết quả đúng hay sai [1]:
| Mã | Ý nghĩa |
|---|---|
| 0 | Không có phát hiện nào cần xử lý |
| 1 | Có phát hiện cần xử lý |
| 2 | Lỗi cách dùng hoặc bị từ chối |
| 3 | Quét không trọn vẹn, một số file hoặc URL không quét được |
Mã 3 là chỗ dễ hiểu nhầm nhất. Tài liệu ghi rõ: coi đó là không kết luận được, bản quét đã không hoàn chỉnh chứ không phải là sạch [1]. Đây đúng là loại chi tiết mà một người vội thường bỏ qua rồi báo cáo sai lên trên.
Skill này giúp gì cho công việc của chúng ta
Đây là phần trả lời câu hỏi thực tế nhất. Bỏ qua kịch bản "làm cho bài viết không bị chấm là AI", vốn không phải mục đích nên theo đuổi trong môi trường doanh nghiệp, vẫn còn bốn nhóm việc mà công cụ này giải quyết đúng vấn đề.
Một, dọn ký tự ẩn trước khi đưa nội dung AI vào hệ thống. Đây là giá trị rõ ràng và ít tranh cãi nhất. Ký tự Unicode vô hình đi kèm nội dung copy từ chatbot có thể làm hỏng việc tìm kiếm trong Confluence, làm lệch cột khi dán vào Google Sheet, làm sai kết quả so khớp chuỗi trong file đối chiếu, và làm rối các trường trong Jira. Đây là lỗi khó truy vì mắt không thấy gì bất thường. Một lượt dọn tầng A giải quyết triệt để, và bản skill clean-user-facing-text làm được việc này mà không cần dựng gì thêm.
Hai, gỡ metadata khỏi ảnh chụp màn hình trước khi gửi ra ngoài. Ảnh chụp màn hình đưa vào tài liệu gửi đối tác có thể mang theo EXIF và XMP chứa tên máy, tên phần mềm, đường dẫn thư mục, đôi khi cả tên người dùng hệ thống. Với tài liệu ra khỏi công ty, đây là rủi ro lộ thông tin thật, không phải rủi ro lý thuyết.
Ba, làm sạch PDF và DOCX trước khi phát hành. File Word và PDF xuất ra từ máy nội bộ mang theo trường tác giả, tên tổ chức, lịch sử chỉnh sửa và đôi khi đường dẫn tới file gốc trên ổ đĩa. Trước khi gửi một tài liệu ra ngoài, việc soi và dọn các trường này là bước vệ sinh cơ bản mà nhiều nơi bỏ qua.
Bốn, rà soát cả thư mục trước một đợt bàn giao. Trước khi bàn giao một bộ tài liệu dự án, chạy audit toàn thư mục cho biết file nào còn mang metadata cần xử lý, thay vì mở từng file kiểm tra tay.
Điểm chung của bốn nhóm việc trên: chúng đều là vệ sinh dữ liệu trước khi thông tin rời khỏi phạm vi kiểm soát, không phải né tránh kiểm tra. Đó là cách dùng công cụ này đúng với tinh thần mà chính tác giả đặt ra.
Năm rủi ro phải cân nhắc trước khi dùng cho công việc thật
Phần này quan trọng nhất với môi trường doanh nghiệp, và cũng là phần các bài giới thiệu công cụ hay nói lướt.
Thứ nhất, file của bạn đi qua một service xử lý. Kiến trúc thin client nghĩa là mọi file bạn nhờ dọn đều được mã hoá base64 và gửi tới một endpoint HTTP [1]. Nếu service chạy trên chính máy bạn ở 127.0.0.1 thì dữ liệu không rời máy. Nhưng nếu ai đó trỏ biến WATERMARKS_SERVICE_URL sang một địa chỉ khác, toàn bộ file đi ra ngoài mà thao tác trên màn hình trông không khác gì. Với tài liệu VNPAY, phải xác nhận service đang chạy ở đâu trước mỗi lần dùng, không mặc định là cục bộ.
Thứ hai, xoá metadata là xoá dấu vết nguồn gốc. Trong một công ty thanh toán, nhiều loại tài liệu cần giữ được dấu vết kiểm toán: ai tạo, tạo lúc nào, chỉnh sửa qua những bước nào. Xoá sạch metadata trên một file thuộc diện phải lưu vết là hành vi cần cân nhắc với bộ phận tuân thủ, không phải thao tác kỹ thuật vô hại. Chỉ áp dụng cho tài liệu mà bạn hoặc phòng bạn sở hữu và không thuộc diện phải lưu vết.
Thứ ba, dùng sai mục đích thì công cụ trở thành rủi ro pháp lý và uy tín. Chính tài liệu skill cấm quảng bá kết quả là bằng chứng do người viết, và yêu cầu cảnh báo khi người dùng nhắm tới gian lận học thuật hay che giấu trái pháp luật [1]. Ngoài ra, ngày càng nhiều quy trình nội bộ và hợp đồng với đối tác có điều khoản về công bố việc sử dụng AI. Dùng công cụ này để né một nghĩa vụ công bố là tạo ra một rủi ro lớn hơn nhiều so với vấn đề nó giải quyết.
Thứ tư, tầng B làm hỏng độ chính xác của nội dung. Như đã nêu ở Bước 5, tác giả thừa nhận việc viết lại làm phẳng giọng văn và làm giảm độ chính xác [2]. Với tài liệu nghiệp vụ, một con số hoặc một tên trường bị diễn đạt lại sai là lỗi nghiêm trọng. Không dùng tầng B cho PRD, URD, tài liệu đối chiếu hay báo cáo có số liệu.
Thứ năm, đây là code của bên thứ ba chạy trên máy bạn. Skill được cài bằng cách clone một repo GitHub cá nhân, license MIT [2]. Repo là mã nguồn mở nên đọc được, nhưng cài nó là chấp nhận chạy code do một cá nhân bên ngoài viết. Với máy có truy cập hệ thống nội bộ, đây là quyết định cần thông qua bộ phận công nghệ thông tin theo quy định nội bộ, không phải quyết định cá nhân.
Lưu ý an toàn dữ liệu: không đưa mã nguồn nội bộ, cấu hình hệ thống, thông tin đối tác hay dữ liệu khách hàng của VNPAY qua bất kỳ service xử lý nào của công cụ AI khi chưa xác nhận công cụ đó đã được duyệt theo quy định nội bộ.
Những gì công cụ này không làm được
Tài liệu skill liệt kê rất sòng phẳng phần giới hạn, và đây là dấu hiệu của một dự án nghiêm túc [1]:
- Tầng A không gỡ được watermark ở mức chọn token. Hai tầng này độc lập với nhau.
- Tầng B không thể xác nhận chắc chắn nếu không có bộ dò và khoá của nhà cung cấp.
- Dọn PDF chỉ là nỗ lực tốt nhất nếu thiếu exiftool, và không đầy đủ nếu thiếu qpdf.
- Watermark ở tầng điểm ảnh chỉ gỡ được qua các backend nặng bên ngoài, và các backend này làm biến dạng ảnh.
- Watermark video chỉ gỡ được từng khung hình, mang tính một phần, và làm mã hoá lại video.
- Watermark âm thanh chỉ gỡ được bằng một chuỗi biến đổi có tính phá huỷ, làm đổi cao độ, tốc độ, chất lượng và cả thời lượng.
- C2PA soft binding, tức phần liên kết lại với manifest từ xa sau khi metadata đã bị xoá, nằm ngoài phạm vi.
- Các dấu vết cài trong quá trình huấn luyện mô hình nằm ngoài phạm vi.
- Bộ chấm điểm SynthID mà công cụ dùng là bản bên ngoài, không phải bộ dò chính thức của Google, và đang ở giấy phép phi thương mại dành cho nghiên cứu. Tài liệu skill cũng ghi rằng bộ dò của Claude đã được công bố nhưng chưa mở công khai [1].
Một nguyên tắc được nhấn mạnh nhiều lần: không bao giờ được trình bày một bộ dò cục bộ như thể nó là bộ dò chính thức của nhà cung cấp [1].
Danh sách kiểm tra khi triển khai
Trước khi cài
- Xác nhận với bộ phận công nghệ thông tin về việc cài skill từ repo bên thứ ba trên máy làm việc
- Cân nhắc dùng bản
clean-user-facing-textnếu nhu cầu chỉ là dọn ký tự ẩn trong văn bản - Đọc qua mã nguồn hoặc ít nhất file
SKILL.mdtrước khi chạy
Trước mỗi lần dùng
- Kiểm tra service đang chạy ở địa chỉ nào, xác nhận là cục bộ nếu file có nội dung nội bộ
- Gọi
/capabilitiesđể biết công cụ nào thực sự có, không hứa thứ chưa kiểm tra - Soi bằng
/inspecttrước, đọc kết quả, rồi mới quyết định có dọn hay không
Khi dọn
- Giữ mặc định ghi ra file mới, không ghi đè file gốc
- Không dùng tầng B cho tài liệu có số liệu, tên hệ thống hay thuật ngữ nghiệp vụ
- Với tài liệu thuộc diện phải lưu vết, hỏi bộ phận tuân thủ trước khi xoá metadata
- Đọc báo cáo tách bạch: phần nào đã kiểm chứng, phần nào chỉ là ước lượng
- Với kết quả audit trả mã 3, coi là chưa kết luận được, không báo cáo là đã sạch
Ba điều cần nhớ
Thứ nhất, dấu vết AI nằm ở ba tầng khác nhau và cần ba cách xử lý khác nhau. Gỡ được ký tự ẩn không có nghĩa là đã gỡ được watermark thống kê, và ngược lại.
Thứ hai, giá trị dùng được ngay của công cụ này với công việc của phòng nằm ở vệ sinh dữ liệu: dọn ký tự ẩn trước khi đưa nội dung vào hệ thống, và gỡ metadata trước khi gửi file ra ngoài. Đó là hai việc có ích thật, làm được ngay, và không vướng vấn đề gì về đạo đức.
Thứ ba, phần viết lại văn bản để né bộ dò là phần vừa không đảm bảo kết quả, vừa làm giảm chất lượng nội dung, vừa dễ đưa người dùng vào tình huống vi phạm quy định công bố. Với tài liệu nghiệp vụ, đây là phần nên bỏ qua.
Cách bắt đầu hợp lý là chọn đúng một việc nhỏ: lần tới khi bạn dán một đoạn AI viết vào Google Sheet của phòng, thử soi nó trước xem có bao nhiêu ký tự vô hình đang đi kèm. Con số đó thường làm người ta bất ngờ.
References
- AugmentClaude — Remove AI Marks (skill của guillaumemeyer, bao gồm toàn văn hướng dẫn cài đặt, mô tả API, workflow và mục Limitations). Available at: https://augmentclaude.com/s/remove-ai-marks-guillaumemeyer (Accessed: 08/09/2026).
- GitHub — guillaumemeyer/watermarks-remover (repo gốc, license MIT, mô tả cách chạy service và phần thừa nhận giới hạn của Layer B). Available at: https://github.com/guillaumemeyer/watermarks-remover (Accessed: 08/09/2026).
- Google DeepMind — SynthID. Available at: https://deepmind.google/science/synthid/ (Accessed: 08/09/2026).
- C2PA — Coalition for Content Provenance and Authenticity (trang chính thức, mô tả chuẩn và danh sách thành viên ban điều hành). Available at: https://c2pa.org/ (Accessed: 08/09/2026).
- Claude Code Docs — Overview. Available at: https://code.claude.com/docs/en/overview (Accessed: 08/09/2026).
