Một trò chơi chữ cần nhiều hơn một danh sách các chuỗi ký tự hợp lệ. Nó cần cho biết mỗi chuỗi có nghĩa là gì, và nghĩa là thứ khó lưu trữ nhất.
Được viết và biên tập bằng tiếng Anh. Bản tiếng Việt này được tạo ra bằng dịch máy; ở những chỗ cần độ chính xác, bản gốc tiếng Anh là bản có thẩm quyền. Đọc bản gốc bằng tiếng Anh →
WordChess được chơi trên bàn cờ 25×25 với một từ điển tiếng Anh gồm 148.941 từ 6, các mục từ dài trung bình 8,6 chữ cái, từ dài nhất lên tới 27. Đó là phần dễ. Một danh sách từ hợp lệ chỉ là một tập hợp các chuỗi mà trò chơi sẽ chấp nhận. Phần thú vị là cho người chơi biết chuỗi ký tự trên bàn cờ có nghĩa là gì, và làm điều đó cùng lúc trên hai mươi hai ngôn ngữ.
Các nhà từ điển học vạch một ranh giới rõ ràng giữa lemma (dạng từ điển) và các dạng biến tố của nó. Lemma là từ đầu mục mà bạn tra cứu, chẳng hạn run (chạy), house (ngôi nhà), be (là). Xoay quanh nó là một hệ biến hình gồm các dạng bề mặt: runs, ran, running. Mỗi dạng mang cùng một nghĩa cốt lõi, chỉ khoác lên một vai trò ngữ pháp khác. 3 Một cuốn từ điển dành phần diễn giải cho lemma và để những cái bóng tự chỉ đường về nhà.
Một từ đổ bao nhiêu cái bóng thì tùy vào ngôn ngữ. Tiếng Anh là ngôn ngữ phân tích: nó dựa vào trật tự từ và các hư từ nhỏ, nên một động từ hiếm khi có quá vài dạng. Tiếng Phần Lan là ngôn ngữ chắp dính, nó tạo nghĩa bằng cách gắn các hậu tố vào một thân từ. Một danh từ tiếng Phần Lan đơn lẻ biến tố theo khoảng mười lăm cách, ở cả số ít lẫn số nhiều, trước khi các đuôi sở hữu và tiểu từ phụ thuộc (clitic) chồng thêm lên trên; số dạng khác nhau trên thực tế lên tới hàng nghìn. 4 Tiếng Hungary gói cả một cụm từ tiếng Anh, in my house (“trong nhà tôi”), vào một từ duy nhất, házamban. 5
Các định nghĩa đến từ Wiktionary, cuốn từ điển tự do mà ai cũng có thể chỉnh sửa. Nó đồ sộ và đa ngôn ngữ: dự án trải rộng trên hơn một trăm phiên bản ngôn ngữ đang hoạt động và hàng chục triệu mục từ, được các tình nguyện viên cùng nhau viết thay vì một ban biên tập được trả lương. 1 Với một trò chơi chạy bằng 22 ngôn ngữ, không có kho từ vựng tự do nào khác sánh được về độ bao phủ.
Nhưng độ bao phủ trên giấy không phải là độ bao phủ mà bạn có thể đọc ra. Wiktionary lưu trữ các dạng biến tố theo cách giúp các biên tập viên con người khỏi phải viết cùng một lời giải nghĩa hàng vạn lần. Thay vì viết đầy đủ một định nghĩa, một mục từ không phải lemma mang một bản mẫu form-of (“dạng của”), một con trỏ nhỏ mà về thực chất nói rằng “đây là một dạng ngữ pháp cụ thể của lemma kia.” 2 Mục từ smoulders không phải là văn xuôi; nó là một bản mẫu hiển thị thành “third-person singular simple present form of smoulder” (dạng hiện tại đơn ngôi thứ ba số ít của smoulder, “cháy âm ỉ”). 1
Những con trỏ này không phải là sai số làm tròn. Trên Wiktionary tiếng Anh, trong khoảng 1,27 triệu định nghĩa, có chừng 478.000, tức hơn hẳn một phần ba, là các định nghĩa “dạng của” thay vì những nghĩa được viết ra đầy đủ. 1 Dữ liệu có ở đó. Chỉ là nó bị gấp lại.
Vì vậy, thách thức thực sự quan trọng chưa bao giờ là “từ này bị thiếu.” Mà là nghĩa của từ nằm bên trong một bản mẫu mà một bộ phân tích ngây thơ sẽ vứt đi. Các định nghĩa của WordChess được xây dựng bằng cách đọc các bản kết xuất (dump) thô của Wiktionary và mở rộng các bản mẫu biến tố theo từng ngôn ngữ, dạy cho bộ phân tích biết mỗi con trỏ có nghĩa là gì và viết lại nó thành một lời giải nghĩa đơn giản. 6
Mỗi ngôn ngữ giấu các dạng của mình sau một bộ máy khác nhau. Tiếng Tây Ban Nha giấu các dạng động từ sau {{forma verbo}}, được phân giải thành “dạng động từ của X.” Tiếng Đức dùng {{Grundformverweis Dekl/Konj}} cho các dạng biến cách và chia động từ. Tiếng Phần Lan dựa vào {{taivutusmuoto}}. Tiếng Nga thường không lưu bản mẫu dạng nào cả, từ biến tố chỉ là một trang chuyển hướng trơn (собаки → собака) mà phải lần theo mới khôi phục được lời giải nghĩa “dạng của”. 6 Xử lý từng quy ước, và độ bao phủ tăng vọt.
| Ngôn ngữ | Trước | Sau | Mức tăng |
|---|---|---|---|
| Tiếng Đức | 45% | 92% | +47 |
| Tiếng Hà Lan | 58% | 90% | +32 |
| Tiếng Phần Lan | 54% | 74% | +20 |
| Tiếng Nga | 20% | 70% | +50 |
| Tiếng Hy Lạp | 15% | 57% | +42 |
Đo từ ghi chú thiết kế và xây dựng của dự án này. Tỷ lệ phần trăm là tỷ lệ mục từ trong từ điển có một định nghĩa dùng được hoặc một lời giải nghĩa “dạng của” đã được phân giải.
Dữ liệu chưa bao giờ bị thiếu. Nó bị gấp vào trong một con trỏ, và việc trao cho cỗ máy từ ngữ có nghĩa là học cách mở nó ra.
Cần phải trung thực về những gì trò chơi giờ đây nắm giữ. Khi WordChess cho thấy собаки là một dạng của собака, “con chó”, nó chẳng hiểu gì cả. Nó đã ánh xạ một chuỗi ký tự sang một chuỗi khác, một lời giải nghĩa, bằng cách lần theo chính những con trỏ mà một biên tập viên con người để lại. Đây là lemma hóa (lemmatization), công cụ chủ lực của xử lý ngôn ngữ tự nhiên: quy một dạng bề mặt về dạng gốc để cỗ máy có ít thứ riêng biệt hơn cần theo dõi. 7
Đó là một kiểu hiểu biết có thật và hữu ích. Nó cho phép trò chơi trả lời câu hỏi “từ này là gì?” ở Athens hay Amsterdam mà không cần một nhà từ điển học trong đội ngũ. Nhưng đó là hiểu biết theo kiểu tra cứu, không phải hiểu biết theo kiểu nắm nghĩa. Lời giải nghĩa là một lời hứa rằng một người, khi đọc nó, sẽ nhận ra từ ấy. Cỗ máy giữ lời hứa; người đọc cung cấp ý nghĩa.
Một số ngôn ngữ chạm tới một giới hạn mà không bộ phân tích nào nâng lên được, vì dữ liệu đơn giản là không có ở đó để mở ra. Các mục từ tiếng Hungary thường chỉ có từ nguyên và một bảng bản dịch, hoàn toàn không có văn bản định nghĩa, nên ngay cả một trình đọc hoàn hảo cũng ra về tay trắng. Những trường hợp khó nhất tập trung ở nơi ngôn ngữ học khó nhất: các ngôn ngữ chắp dính như tiếng Phần Lan và tiếng Hungary, vốn sinh ra những hệ biến hình khổng lồ, và các hệ chữ Kirin và Hy Lạp, nơi độ bao phủ của cộng đồng vốn đã mỏng hơn ngay từ đầu. Tiếng Hy Lạp đã tăng từ 15% lên 57%; việc nó dừng lại còn cách xa mức 92% của tiếng Đức là một sự thật về nguồn dữ liệu, không phải về mã nguồn. 6