Một trò chơi từ cần nhiều hơn một danh sách các chuỗi hợp lệ. Nó cần nói rõ mỗi từ means, và ý nghĩa là điều khó lưu trữ nhất.
WordChess plays on a 25×25 board with a 148,941-word English dictionary6, các mục trung bình 8,6 chữ cái, một số dài đến 25. Đó là phần dễ dàng. Một danh sách các từ hợp lệ chỉ là một tập hợp các chuỗi mà trò chơi sẽ chấp nhận. Phần thú vị là nói cho người chơi biết chuỗi trên bàn cờ means, và làm điều đó đồng thời trong hai mươi hai ngôn ngữ.
Các nhà biên soạn từ điển vạch ra một ranh giới rõ ràng giữa một lemma và các dạng biến đổi của nó. Lemma là từ gốc mà bạn tra cứu, run, house, be. Xung quanh nó là một hệ thống các dạng bề mặt: runs, ran, running. Mỗi dạng mang cùng một nghĩa cốt lõi, được khoác lên một vai trò ngữ pháp khác nhau.3 Từ điển dành phần văn xuôi cho lemma và để các bóng mờ tự chỉ về nhà.
Số lượng bóng mờ mà một từ tạo ra phụ thuộc vào ngôn ngữ. Tiếng Anh là analytic: nó dựa vào thứ tự từ và các từ phụ trợ nhỏ, nên một động từ hiếm khi có nhiều hơn một vài dạng. Tiếng Phần Lan là agglutinative, nó xây dựng nghĩa bằng cách gắn các hậu tố vào gốc từ. Một danh từ tiếng Phần Lan duy nhất bẻ biến theo khoảng mười lăm cách chia, ở số ít và số nhiều, trước các đuôi sở hữu và các từ bám dính xếp chồng lên nhau; số lượng các dạng thức riêng biệt thực tế lên đến hàng nghìn.4 Tiếng Hungary gom trọn một cụm từ tiếng Anh, in my house, vào một từ, házamban.5
Các định nghĩa được lấy từ Wiktionary, cuốn từ điển miễn phí mà bất kỳ ai cũng có thể chỉnh sửa. Nó rất đồ sộ và đa ngôn ngữ: dự án trải dài hơn một trăm phiên bản ngôn ngữ đang hoạt động và hàng chục triệu mục từ, được viết hợp tác bởi các tình nguyện viên thay vì một ban biên tập được trả lương.1 Đối với một trò chơi chạy bằng 22 ngôn ngữ, không có từ điển miễn phí nào khác đến gần mức độ bao phủ này.
Nhưng độ bao phủ trên giấy không phải là độ bao phủ mà bạn có thể đọc to. Wiktionary lưu trữ các dạng biến đổi theo cách giúp các biên tập viên con người khỏi phải viết cùng một chú giải mười nghìn lần. Thay vì viết ra định nghĩa, một mục không phải gốc từ mang một mẫu form-of, một con trỏ nhỏ nói, về cơ bản, "đây là một dạng ngữ pháp cụ thể của gốc từ đó."2 Mục từ smoulders không phải là văn xuôi; nó là một mẫu (template) hiển thị dưới dạng "thể ngôi thứ ba số ít hiện tại đơn của smoulder."1
Những chỉ báo này không phải là sai số làm tròn. Trên Wiktionary tiếng Anh, trong khoảng 1,27 triệu định nghĩa, có khoảng 478.000, tức là hơn một phần ba, là các định nghĩa dạng "dạng của" thay vì các nghĩa được viết ra đầy đủ.1 Dữ liệu đã có sẵn. Chỉ là nó được gấp gọn lại.
Vì vậy, thách thức thực sự quan trọng chưa bao giờ là "từ đó bị thiếu". Mà là ý nghĩa của từ đó nằm bên trong một mẫu mà trình phân tích ngây thơ sẽ vứt bỏ. Các định nghĩa của WordChess được xây dựng bằng cách đọc các bản dump Wiktionary thô và mở rộng các mẫu biến đổi theo từng ngôn ngữ, dạy cho trình phân tích biết ý nghĩa của mỗi chỉ báo và viết lại chúng thành một ghi chú giải thích đơn giản.6
Mỗi ngôn ngữ đều giấu các dạng từ của mình sau những cơ chế khác nhau. Tiếng Tây Ban Nha giấu các dạng động từ sau {{forma verbo}}, được giải quyết thành "dạng động từ của X". Tiếng Đức sử dụng {{Grundformverweis Dekl/Konj}} cho các dạng biến cách và chia động từ. Tiếng Phần Lan dựa vào {{taivutusmuoto}}. Tiếng Nga thường không lưu trữ bất kỳ mẫu hình thức nào, từ đã biến đổi là một đường dẫn (собаки → собака) mà phải được truy theo để khôi phục chú giải "hình thức của".6 Xử lý từng quy ước, và phạm vi bao phủ tăng vọt.
| Ngôn ngữ | Trước | Sau | Tăng |
|---|---|---|---|
| Tiếng Đức | 45% | 92% | +47 |
| Tiếng Hà Lan | 58% | 90% | +32 |
| Tiếng Phần Lan | 54% | 74% | +20 |
| Tiếng Nga | 20% | 70% | +50 |
| Tiếng Hy Lạp | 15% | 57% | +42 |
Đo từ các ghi chú thiết kế và xây dựng của dự án này. Phần trăm là tỷ lệ các mục từ điển có định nghĩa khả dụng hoặc chú giải "hình thức của" đã được giải quyết.
Dữ liệu không bao giờ bị thiếu. Nó được gấp gọn vào một con trỏ, và việc cung cấp cho máy tính từ đó có nghĩa là học cách mở nó ra.
Đáng lẽ phải trung thực về những gì trò chơi hiện đang nắm giữ. Khi WordChess hiển thị rằng собаки là một dạng của собака, "chó", nó không hiểu bất cứ điều gì. Nó đã ánh xạ một chuỗi sang một chuỗi khác, một chú giải, bằng cách làm theo cùng các con trỏ mà một biên tập viên con người để lại. Đây là lemmatization, công cụ chủ lực của xử lý ngôn ngữ tự nhiên: giảm một dạng bề mặt xuống dạng gốc để máy tính phải theo dõi ít các thực thể riêng biệt hơn.7
Đó là một kiểu biết thực sự và hữu ích. Nó cho phép trò chơi trả lời "từ này là gì?" ở Athens hay Amsterdam mà không cần một nhà từ điển học trong đội ngũ. Nhưng đó là kiểu biết-dạng-tra-cứu, không phải kiểu biết-dạng-ý-nghĩa. Chú giải là một lời hứa rằng một người, khi đọc nó, sẽ nhận ra từ đó. Máy tính giữ lời hứa; người đọc cung cấp ý nghĩa.
Một số ngôn ngữ chạm đến một trần mà không bộ phân tích nào có thể nâng lên, vì dữ liệu đơn giản là không có để triển khai. Các mục tiếng Hungary thường chỉ mang theo một nguồn gốc và một bảng dịch, không có văn bản định nghĩa nào cả, nên ngay cả một người đọc hoàn hảo cũng ra về tay trắng. Các trường hợp khó nhất tập trung ở nơi ngôn ngữ học khó nhất: các ngôn ngữ kết dính như tiếng Phần Lan và tiếng Hungary, tạo ra các hệ thống biến đổi khổng lồ, và các bảng chữ cái Cyrillic và Hy Lạp, nơi sự bao phủ của cộng đồng vốn đã mỏng hơn. Tiếng Hy Lạp đã tăng từ 15% lên 57%; việc nó dừng lại xa so với 92% của tiếng Đức là một sự thật về nguồn, không phải về mã. 6