LingoBridge

Tra từ, dịch câu, hỏi AI

Mỗi con số trong ứng dụng đều truy được về nguồn.

Trang này liệt kê toàn bộ nguồn dữ liệu đang dùng, số mục từ lấy từ mỗi nguồn, giấy phép nội dung và những giới hạn mà nhóm tác giả biết rõ.

Tổng mục từ
2.590
Có phiên âm
2.272
Ảnh tư liệu
41 ảnh
Cập nhật 2026-08-15

Toàn bộ dữ liệu được tải lại bằng lệnh có sẵn trong dự án, không nhập tay, nên bất kỳ ai cũng có thể chạy lại và kiểm tra con số.

Nguồn từ vựng

NguồnSố mục từCó phiên âmGiấy phép

Wiktionary tiếng Việt - mục từ tiếng Tày

Mở một mục từ mẫu
2.2452.160CC BY-SA 4.0

Từ điển Tày - Việt (bản in, số hóa bằng nhận dạng ảnh)

32693Số hóa từ bản in phục vụ học tập, phi thương mại

Tiếng Tày - Từ điển Tày ngữ

Mở một mục từ mẫu
1515Xem trang nguồn

Thực tế giao tiếp bản địa

44Xem trang nguồn
Quy trình xử lý dữ liệu
  1. 1

    Thu thập

    Tải mục từ tiếng Tày từ Wiktionary tiếng Việt, tư liệu ảnh từ Wikimedia Commons và bài đọc từ Wikipedia tiếng Việt bằng các kịch bản trong thư mục scripts.

  2. 2

    Số hóa sách in

    Bốn tập Từ điển Tày - Việt được chụp thành ảnh, nhận dạng chữ bằng mô hình thị giác, làm sạch lỗi chính tả rồi bóc tách thành mục từ.

  3. 3

    Làm sạch và loại bỏ dữ liệu sai

    Những mục từ do mô hình tự nghĩ ra ở trang bìa sách đã bị loại bỏ thủ công. Các dòng minh họa chỉ có tiếng Việt được ghi là câu minh họa, không coi là cặp câu song ngữ.

  4. 4

    Đối chiếu chéo

    Mục từ nào xuất hiện ở nhiều nguồn độc lập sẽ được đánh dấu để người dùng biết mức tin cậy cao hơn. Mục từ chỉ có một nguồn vẫn giữ nhãn cần người bản ngữ kiểm chứng.

Mức độ kiểm chứng
  • 814 mục dẫn được tới từ điển giấy đã xuất bản.
  • 292 mục được ít nhất hai nguồn độc lập cùng ghi nhận.
  • 179 câu ví dụ thật sự có cả vế tiếng Tày và vế tiếng Việt.
Giới hạn nhóm tác giả biết rõ
  • 452 mục từ số hóa từ sách in còn lỗi nhận dạng chữ, chưa được người bản ngữ rà soát.
  • Phần nhập giọng nói dùng công cụ nhận dạng tiếng Việt của trình duyệt, chưa nhận dạng được lời nói tiếng Tày.
  • Phần đọc thành tiếng là giọng đọc tiếng Việt đọc mặt chữ, không phải giọng người Tày bản ngữ.
  • Chữ viết tiếng Tày chưa được chuẩn hóa thống nhất nên cùng một từ có thể có nhiều cách ghi khác nhau giữa các nguồn.

Tư liệu văn hóa

Ảnh lấy từ Wikimedia Commons, bài đọc lấy từ Wikipedia tiếng Việt. Mỗi tư liệu đều kèm tác giả, giấy phép và liên kết tới trang gốc.

CC BY-SA 3.0: 10 ảnhPublic domain: 2 ảnhCC0: 6 ảnhCC BY-SA 4.0: 2 ảnhCC BY 3.0: 2 ảnhCC BY-SA 2.0: 19 ảnh