Trợ giúp:Về dữ liệu
Wikidata là cơ sở kiến thức miễn phí mà con người và máy móc có thể được đọc và chỉnh sửa. Dự án này chỉ là một trong nhiều dự án dựa trên wiki do Wikimedia Foundation, một tổ chức phi lợi nhuận có nội dung miễn phí, có lẽ được biết đến nhiều nhất với Wikipedia. Mỗi dự án của Wikimedia Foundation đều có trọng tâm riêng — ví dụ: Wikipedia dành cho nội dung bách khoa toàn thư, Wikimedia Commons hỗ trợ hình ảnh và các tập tin đa phương tiện khác, và Wiktionary cung cấp thông tin từ vựng về các từ như định nghĩa và từ đồng nghĩa. Trọng tâm của Wikidata là dữ liệu có cấu trúc.
Trang này nhằm mục đích tổng quan về dữ liệu có cấu trúc. Nếu bạn đã quen thuộc với dữ liệu có cấu trúc, nhưng muốn tìm hiểu thêm về cách sử dụng cụ thể của nó trên Wikidata, cách truy cập dữ liệu trên Wikidata hoặc cách đóng góp dữ liệu của dự án của riêng bạn cho Wikidata, vui lòng chuyển tới phần về liên kết dữ liệu.
Hiểu về Wikidata
Dữ liệu có cấu trúc đề cập đến dữ liệu đã được tổ chức và được lưu trữ theo một cách được định nghĩa, thường với mục đích mã hóa ý nghĩa và duy trì mối quan hệ giữa các điểm dữ liệu khác nhau trong một tập dữ liệu.
Nhưng dù sao thì dữ liệu là gì? Và tại sao bạn nên quan tâm đến dữ liệu có cấu trúc nói riêng?
Phân biệt dữ liệu
Dữ liệu lớn, dữ liệu thực nghiệm, dữ liệu mở, siêu dữ liệu — bạn có thể đã gặp một số hoặc thậm chí tất cả các thuật ngữ này trước đây.
Mỗi thuật ngữ có nghĩa khác nhau một chút nhưng tất cả đều được xây dựng dựa trên sự hiểu biết chung về dữ liệu và tiềm năng của nó trong việc mô tả và nâng cao hiểu biết của chúng ta về thế giới xung quanh.
Là một khái niệm trừu tượng, dữ liệu có thể được coi là tiền thân của thông tin, nghĩa là thông tin có thể được suy ra hoặc kế thừa từ dữ liệu.
Điều này là bởi vì, khi rút gọn đến bản chất, dữ liệu chỉ đơn giản là một tập hợp các giá trị về các sự vật. Những giá trị này có thể là định lượng, chẳng hạn như một phép đo hay một con số. Chúng cũng có thể mang tính định tính, ví dụ như một mô tả hay một so sánh. Chẳng hạn, ta có thể nói rằng '8.848 m (29.029 ft)' là một giá trị dữ liệu về chiều cao của núi Everest, và 'màu đỏ' là một giá trị dữ liệu về màu sắc của một chiếc xe.
Như đã đề cập trước đó, thông tin không giống với dữ liệu mà là sản phẩm của việc thu thập và phân tích dữ liệu. Ví dụ, '8.848' (dữ liệu) tự nó chỉ là một con số khá vô nghĩa, ngay cả khi ta biết đó là chiều cao của một ngọn núi; chỉ khi ta hiểu về các tiêu chuẩn đo chiều cao và biết thêm chiều cao của các ngọn núi khác, ta mới có thể nói rằng 'Núi Everest là ngọn núi cao nhất thế giới với độ cao 8.848 m' (thông tin). Việc suy luận, rút ra những hiểu biết và tri thức mới, cũng như thiết lập các sự thật, sẽ trở nên dễ dàng hơn nhiều khi dữ liệu được cấu trúc — chúng ta sẽ quay lại ý tưởng này sau.
Dữ liệu ở đâu?
Dữ liệu hiện diện ở khắp mọi nơi. Có rất nhiều loại nguồn dữ liệu khác nhau, bao gồm dữ liệu tài chính, sinh học và xã hội. Ngay cả trang này cũng có dữ liệu! Ví dụ: nó có tổng số từ, ngày được tạo và lần chỉnh sửa gần nhất, chủ đề và nội dung, số lượt xem trang, cũng như các ngôn ngữ mà nội dung được cung cấp.
Tuy nhiên, mặc dù mọi thứ đều có thể trở thành một nguồn dữ liệu, nhưng dữ liệu nếu không được ghi lại và tổ chức thì gần như chẳng tồn tại. Nếu thiếu một cấu trúc nền tảng, dữ liệu sẽ trở nên vô nghĩa và không thể cung cấp thông tin hữu ích.
Khi nói 'được tổ chức', chúng tôi muốn nói đến việc dữ liệu được phân loại theo một cách chuẩn hóa và rõ ràng, không gây nhầm lẫn. Dữ liệu đã được tổ chức và phân loại như vậy chính là thứ mà chúng ta gọi là dữ liệu có cấu trúc.
Cấu trúc nằm ở đâu?
Trên web, cấu trúc giữ vai trò thống trị. Hầu hết các trang web được tạo bằng HTML, một ngôn ngữ đánh dấu cung cấp phần khung cơ bản, hay nói cách khác là cấu trúc, cho một trang web.
Các ngôn ngữ đánh dấu cũng được dùng để gắn thẻ và mô tả nội dung trang, giúp các công cụ tìm kiếm, bot và những ứng dụng như nguồn cấp RSS có thể dễ dàng xử lý và 'hiểu' nội dung đó. Ví dụ, thẻ cho máy móc biết tên của một trang web là gì.

Thay vì chỉ hỗ trợ cấu trúc và các thành phần chung của một trang web, Wikidata cung cấp cấu trúc cho toàn bộ thông tin được lưu trữ trong Wikipedia và các dự án Wikimedia khác. Wikidata được xây dựng dựa trên phần mềm MediaWiki, giống như các dự án Wikimedia khác, và được mở rộng bởi Wikibase, một phần mềm vận hành Wikidata và được thiết kế để quản lý khối lượng lớn dữ liệu có cấu trúc. Cấu trúc không được thêm trực tiếp vào nội dung của Wikipedia hay các trang khác của Wikimedia, như trong bảng hoặc danh sách; cũng không đòi hỏi người dùng Wikidata phải có kiến thức về ngôn ngữ đánh dấu, lược đồ dữ liệu, ký pháp đối tượng hay các cú pháp đặc biệt khác. Thay vào đó, dữ liệu được thêm và chỉnh sửa trong Wikidata thông qua các biểu mẫu nhập liệu thân thiện với người dùng.
Tất cả dữ liệu được lưu trữ trên Wikidata có thể được sử dụng để tạo ra nhiều loại danh sách, bảng hoặc các trang có cấu trúc khác một cách tự động và luôn được cập nhật, trên bất kỳ trang Wikimedia nào hoặc ở nơi khác.
Cấu trúc hóa dữ liệu
| Dữ liệu về các ngọn núi | ||
|---|---|---|
| Núi | Thuộc tính | Giá trị |
| Mount Everest | height | 8,848 m |
| K2 | hauteur | 8,611 m |
| Kanchenjunga | height | 8,586 m |
| Lhotse | height | 27940 ft |
Để minh họa tầm quan trọng của cấu trúc, hãy cùng xem Bảng 1. Trong bảng này, chúng ta có thể thấy dữ liệu về bốn ngọn núi cao nhất trên Trái Đất. Nếu muốn biết một thông tin cụ thể, chẳng hạn như độ cao của ngọn núi cao thứ hai thế giới, chúng ta có thể tra cứu dữ liệu được cung cấp để tìm giá trị chính xác. Tuy nhiên, chỉ có ba trong số bốn ngọn núi có dữ liệu được phân loại là giá trị về độ cao, và chỉ hai trong ba ngọn núi đó có giá trị tính bằng mét. Mặc dù chúng ta biết rằng height và hauteur (tiếng Pháp, nghĩa là chiều cao) có thể được hiểu là tương đương nhau, cũng như cách chuyển đổi giữa mét và feet, nhưng một máy tính hoặc một chương trình tự động có thể sẽ không hiểu được điều đó.
Nếu dữ liệu được ghi chép thống nhất, thì cả con người lẫn máy tính sẽ dễ dàng xử lý thông tin và tìm ra câu trả lời về ngọn núi cao thứ hai, cho dù cách trình bày có khác nhau.
Mô hình hóa dữ liệu
Các tập hợp dữ liệu có cấu trúc, như Wikidata, được tổ chức theo một mô hình dữ liệu. Mô hình dữ liệu có thể được máy tính đọc hiểu, nghĩa là chúng có thể được máy tính xử lý. Tuy máy tính rất mạnh mẽ, nhưng trong nhiều trường hợp, chúng lại không thông minh bằng con người khi phải suy luận đơn giản. Chẳng hạn, trong ví dụ ở trên, một máy tính sẽ không thể tự biết rằng 'height' và 'hauteur' là cùng một khái niệm nếu không được chỉ rõ theo một cách nào đó.
-
khoản mục: Trái Đất
-
thuộc tính: điểm cao nhất
-
giá trị: Everest
| Dữ liệu về các ngọn núi | ||
|---|---|---|
| Núi | Thuộc tính | Giá trị |
| Mount Everest | continent | Asia |
| K2 | continent | Asia |
| Kanchenjunga | continent | Asia |
| Lhotse | continent | Asia |

Các mô hình dữ liệu khác nhau tùy thuộc vào nhu cầu phân tích, phạm vi và khung khái niệm của bộ dữ liệu, cũng như các yêu cầu kỹ thuật của một hệ thống. Tuy nhiên, tất cả các mô hình dữ liệu thường sẽ xác định loại dữ liệu nào có thể được hệ thống hỗ trợ và những mối quan hệ nào giữa các giá trị có thể được hiểu và biểu diễn. Ví dụ, một mô hình dữ liệu có thể quy định rằng height và hauteur được ánh xạ với nhau để cả hai thuật ngữ cùng đại diện cho một khái niệm, hoặc rằng các phép đo bằng feet được tự động chuyển đổi sang mét. Mô hình dữ liệu của Wikidata định hình cách người dùng có thể chỉnh sửa và thêm dữ liệu vào hệ thống. Đây cũng là một dự án đang tiếp tục phát triển, với các kiểu dữ liệu mới được bổ sung vào mô hình theo thời gian.
Mô hình dữ liệu về cơ bản còn chuyển đổi các mẫu ngôn ngữ tự nhiên của con người thành thứ có thể được máy tính xử lý. Ví dụ, trong tiếng Anh, chúng ta có thể nói:
- "Núi Everest là ngọn núi cao nhất thế giới"
Đây cũng chính là dạng nội dung thô, chưa có cấu trúc, hiện đang tồn tại trên Wikipedia và tất cả các trang Wikimedia khác.
Trên Wikidata, điều này sẽ được biểu diễn bằng một phát biểu, bao gồm một cặp thuộc tính – giá trị về một mục, trong trường hợp này là Trái Đất:
Earth (Q2) (mục) → highest point (P610) (thuộc tính) → Mount Everest (Q513) (giá trị)
Ngoài ra, Wikidata cũng sẽ chứa một phát biểu về mục Núi Everest (chỉ ra rằng đó là một ngọn núi):
Mount Everest (Q513) (mục) → instance of (P31) (thuộc tính) → mountain (Q8502) (giá trị)
Lưu ý rằng, vì các mục khác cũng có thể được dùng làm giá trị cho các phát biểu, và tất cả mục đều có trang riêng duy nhất trên Wikidata, điều này có nghĩa là tất cả các mục trong hệ thống có thể được liên kết với nhau thông qua một chuỗi các phát biểu. Vì Wikidata sử dụng định dạng có thể đọc được bởi máy, việc liên kết dữ liệu này cho phép các mối quan hệ và kết nối mới được khám phá và xử lý bởi máy móc. Ví dụ, trong Bảng 2, chúng ta thấy dữ liệu mới về các ngọn núi, lần này là về vị trí địa lý theo châu lục nhưng không có thông tin về chiều cao. Giả sử dữ liệu châu lục này được liên kết với dữ liệu chiều cao của núi, chúng ta sẽ tự tin hơn khi đưa ra dự đoán hoặc rút ra những kết luận nhất định về nó, chẳng hạn như nói rằng châu Á là nơi có các ngọn núi cao nhất thế giới.
Liên kết hóa dữ liệu
Bên cạnh việc là một tập hợp dữ liệu có cấu trúc, Wikidata còn hỗ trợ dữ liệu liên kết. Dữ liệu liên kết là thuật ngữ chỉ việc xuất bản dữ liệu có cấu trúc sao cho chúng có thể được liên kết với nhau.
Đối với Wikidata, điều này có nghĩa là dữ liệu do các tình nguyện viên đóng góp cũng có thể được liên kết với các bộ dữ liệu, cơ sở dữ liệu và nguồn dữ liệu khác trên toàn web, cũng như từ nhiều sáng kiến bên ngoài hệ sinh thái Wikimedia. Ví dụ, hiện tại Wikidata cho phép liên kết với các bộ dữ liệu và cơ sở dữ liệu đa dạng như Google Books, Canmore (một trong các cơ sở dữ liệu của Historic Environment Scotland), Vatican Library, OmegaWiki, và MusicBrainz.


Bằng cách tuân theo các nguyên tắc và thực hành của dữ liệu liên kết, Wikidata cũng có thể hỗ trợ và được sử dụng bởi các dự án khác.
Nguyên tắc dữ liệu liên kết
Wikidata sử dụng các định danh duy nhất, hay định danh tài nguyên đồng nhất (URI), cho tất cả các mục của nó theo các tiêu chuẩn của dữ liệu liên kết.
Mặc dù Wikidata sử dụng một mô hình dữ liệu riêng biệt, nội dung của nó vẫn có thể được xuất ra dưới dạng RDF, một định dạng tiêu chuẩn và phổ biến để biểu diễn dữ liệu liên kết. Trong ngữ cảnh của Wikidata, một mệnh đề bao gồm một mục và một cặp thuộc tính – giá trị. Với những ai quen thuộc với khái niệm dữ liệu liên kết, mục có thể được xem là phần chủ ngữ trong một bộ ba; thuộc tính là vị ngữ; và giá trị thể hiện tân ngữ của bộ ba."
Tuy nhiên, các mệnh đề Wikidata có thể chứa thêm những thành phần khác ngoài bộ ba chủ ngữ – vị ngữ – tân ngữ, chẳng hạn như nguồn tham khảo và điều kiện bổ sung (xem thêm tại Trợ giúp:Mệnh đề). Điều này khiến cho việc biểu diễn đầy đủ nội dung của Wikidata bằng ngôn ngữ RDF trở nên phức tạp hơn — bạn có thể tìm hiểu thêm về những thách thức này trong tài liệu Giới thiệu Wikidata với Web Dữ liệu Liên kết.
Đóng góp dữ liệu
Nếu bạn có bộ dữ liệu muốn đóng góp cho Wikidata, vui lòng xem Wikidata:Data donation.
Truy cập dữ liệu
Dữ liệu ở Wikidata được xuất bản theo Creative Commons Public Domain Dedication 1.0, cho phép tái sử dụng dữ liệu miễn phí. Bạn có thể sao chép, sửa đổi, phân phối và thực hiện dữ liệu, ngay cả cho các mục đích thương mại, tất cả mà không cần xin phép.
Xem Truy cập dữ liệu để biết thêm chi tiết về các cách khác nhau để truy cập dữ liệu của Wikidata bằng lập trình.
Xem thêm
Về các trang liên quan, xem:
Để biết thêm thông tin và hướng dẫn, vui lòng xem:
- Project chat, for discussing all and any aspects of Wikidata
- Wikidata:Glossary, the glossary of terms used in this and other Help pages
- Help:FAQ, frequently asked questions asked and answered by the Wikidata community
- Help:Contents, the Help portal featuring all the documentation available for Wikidata