Một đồ án kết luận: “Khu vực có mật độ đường thấp, cần bổ sung mạng lưới.” Căn cứ là lớp đường tải từ OpenStreetMap. Đi thực địa thì thấy khu đó chằng chịt hẻm 2–3 m, chỉ là chưa ai vẽ lên OSM. Kết luận sai không vì phân tích kém mà vì không kiểm dữ liệu đầu vào.
Dữ liệu mở là nguồn quý cho sinh viên và người làm nghiên cứu, nhất là khi dữ liệu chính thức khó tiếp cận. Nhưng mỗi nguồn được tạo ra cho một mục đích, với độ phủ và sai số riêng. Biết điểm mù của nguồn cũng quan trọng như biết cách tải nó về.
OpenStreetMap: bản đồ do cộng đồng vẽ
Có gì: đường, công trình, sử dụng đất, điểm dịch vụ (trường, chợ, bệnh viện, quán), sông hồ. Tải bằng plugin QuickOSM trong QGIS, hoặc các dịch vụ trích xuất theo vùng.
Điểm mạnh: cập nhật liên tục, có thuộc tính phong phú, miễn phí và dùng được cho mục đích học tập, nghiên cứu (cần ghi nguồn theo giấy phép ODbL).
Điểm mù:
- Độ phủ không đều: trung tâm thành phố lớn khá đầy đủ; ven đô, thị xã nhỏ, hẻm sâu thường thiếu.
- Công trình có thể chỉ vẽ một phần, không có số tầng.
- Điểm dịch vụ nhỏ (quán tạp hoá, tiệm sửa xe) thiếu nhiều.
- Thẻ phân loại không nhất quán giữa người vẽ.
Cách kiểm: chồng lên ảnh vệ tinh độ phân giải cao, chọn ngẫu nhiên vài ô 200 × 200 m, so số đường và công trình vẽ trên OSM với số nhìn thấy trên ảnh. Ghi tỷ lệ phủ vào thuyết minh.
Ảnh vệ tinh Sentinel-2 và Landsat
| Sentinel-2 | Landsat 8/9 | |
|---|---|---|
| Độ phân giải | 10 m (băng nhìn thấy, cận hồng ngoại) | 30 m (quang học), băng nhiệt gốc 100 m |
| Chu kỳ chụp lại | Khoảng 5 ngày | Khoảng 8 ngày khi kết hợp hai vệ tinh |
| Dùng cho | Lớp phủ bề mặt, chỉ số thực vật, theo dõi đô thị hoá | Nhiệt độ bề mặt, chuỗi thời gian dài từ nhiều thập kỷ |
Điểm mù: mây, rất phổ biến ở Việt Nam mùa mưa. Cần lọc ảnh theo tỷ lệ mây và chọn ảnh mùa khô. 10 m không đủ để nhận diện từng ngôi nhà ống rộng 4 m; nó cho biết khu vực xây dựng dày đặc, không cho biết từng công trình.
Cách dùng hợp lý: tính chỉ số thực vật NDVI để so độ phủ xanh giữa các phường; so ảnh hai thời điểm cách nhau 5–10 năm để thấy vùng đô thị hoá mới.
Dân số dạng lưới: WorldPop, GHSL
WorldPop cung cấp ước tính dân số trên lưới khoảng 100 m; GHSL (Global Human Settlement Layer) của Uỷ ban châu Âu cung cấp lớp dân số và bề mặt xây dựng theo nhiều mốc thời gian.
Điểm quan trọng cần hiểu: đây là ước tính mô hình hoá, không phải đếm. Tổng dân số cấp hành chính (từ điều tra) được phân bổ xuống từng ô dựa trên các lớp như công trình, đèn ban đêm, đường. Ở cấp một ô 100 m, sai số có thể lớn; cộng lên cấp phường, quận thì đáng tin hơn.
Cách dùng: cộng dân số lưới trong vùng phục vụ của trường học, điểm dừng xe buýt để ước lượng số người được phục vụ. Luôn ghi rõ “ước tính theo WorldPop năm X”, và so tổng với số liệu điều tra dân số công bố chính thức của khu vực.
Dữ liệu công trình từ trí tuệ nhân tạo
Một số tổ chức công bố lớp đường viền công trình được trích xuất tự động từ ảnh vệ tinh bằng học máy, phủ nhiều nước, trong đó có Việt Nam (ví dụ bộ Open Buildings của Google, bộ Global ML Building Footprints của Microsoft). Chúng hữu ích khi OSM thiếu công trình.
Điểm mù: ở khu nhà ống liền kề, mô hình thường gộp cả dãy nhà thành một khối hoặc tách sai. Không có số tầng. Có đối tượng nhận nhầm (mái che, bãi container). Kiểm bằng ảnh độ phân giải cao trước khi dùng để đếm công trình.
Mô hình số độ cao
SRTM, Copernicus DEM (khoảng 30 m) miễn phí. Như đã nói ở bài về ngập đô thị, sai số chiều đứng vài mét khiến chúng kém tin cậy ở vùng đồng bằng bằng phẳng, và chúng là mô hình bề mặt lẫn cả nhà, cây. Dùng để hiểu địa hình vùng, không dùng để thiết kế san nền.
Nguồn khác đáng biết
- Dữ liệu thống kê công bố của cơ quan thống kê: dân số, hộ, cơ cấu tuổi theo đơn vị hành chính. Là mốc để hiệu chỉnh các lớp mô hình.
- Dữ liệu tuyến xe buýt: một số thành phố có thông tin tuyến, điểm dừng công khai; đôi khi có ở định dạng GTFS.
- Ảnh lịch sử: công cụ xem ảnh lịch sử trên các nền tảng bản đồ trực tuyến giúp thấy thay đổi qua các năm.
- Dữ liệu khí hậu: số liệu mưa, nhiệt từ trạm khí tượng và các bộ dữ liệu tái phân tích toàn cầu.
Nguyên tắc chung khi dùng dữ liệu mở
- Ghi nguồn, năm, độ phân giải cho mọi lớp trên bản đồ.
- Kiểm mẫu với thực địa hoặc ảnh độ phân giải cao, ghi tỷ lệ sai.
- Dùng ở quy mô phù hợp: dữ liệu 100 m không dùng để kết luận về một lô đất.
- So chéo hai nguồn khi có thể: OSM và dữ liệu công trình AI; WorldPop và thống kê.
- Nói rõ giới hạn trong thuyết minh. Hội đồng đánh giá cao sự trung thực về dữ liệu hơn là con số bóng bẩy.
Áp dụng thực tế: bảng kiểm dữ liệu một trang
Với mỗi lớp dữ liệu dùng trong đồ án, lập một dòng gồm: tên lớp, nguồn, ngày tải, năm dữ liệu, độ phân giải hoặc tỷ lệ, hệ tọa độ, cách kiểm, tỷ lệ sai ước tính, giới hạn sử dụng. Đặt bảng này ở phụ lục.
Làm bảng này ngay từ tuần đầu, khi dữ liệu còn ít. Đến lúc bảo vệ, khi có người hỏi “số liệu này lấy ở đâu, tin được không”, bạn chỉ cần lật tới trang phụ lục.
Câu hỏi thường gặp
Dữ liệu OpenStreetMap có tin cậy cho đồ án không?
Tin cậy ở mức khác nhau tùy khu vực. Trung tâm thành phố lớn khá đầy đủ, ven đô và hẻm sâu thường thiếu. Cần kiểm bằng ảnh vệ tinh và thực địa trước khi dùng.
Sentinel-2 và Landsat khác nhau thế nào?
Sentinel-2 có độ phân giải 10 m, chụp lại khoảng 5 ngày, tốt cho lớp phủ bề mặt. Landsat 30 m nhưng có băng nhiệt và chuỗi dữ liệu dài nhiều thập kỷ.
WorldPop là gì?
Là bộ dữ liệu ước tính dân số trên lưới khoảng 100 m, được mô hình hoá từ số liệu điều tra và các lớp phụ trợ. Đáng tin hơn khi cộng lên cấp phường, quận.
Dữ liệu công trình từ AI có dùng được ở khu nhà ống không?
Dùng được một phần, nhưng mô hình thường gộp hoặc tách sai dãy nhà liền kề và không có số tầng. Cần kiểm bằng ảnh độ phân giải cao.
Cần ghi gì khi dùng dữ liệu mở trong đồ án?
Ghi nguồn, năm dữ liệu, ngày tải, độ phân giải, hệ tọa độ, cách kiểm và giới hạn sử dụng cho từng lớp.