Sinh ra và phán đoán là hai bài toán khác nhau
Kết luận phần trước là: phán đoán mà việc bố trí cốt thép cần đến đã được mặc định là dữ liệu đầu vào của API. Vậy nếu chính phán đoán đó cũng do AI làm thì sao? Chúng tôi trả lời bằng hợp đồng của chính nhà cung cấp và các nghiên cứu bình duyệt, không phải bằng trang quảng cáo.
Đăng ngày 10 tháng 8, 2026·Thời điểm kiểm chứng · Tháng 8/2026
Tóm tắt chính
- Điều khoản sử dụng của Autodesk §11.1 — “The Offerings are tools … not a substitute for Your professional judgment”. Không phải điều khoản riêng cho AI mà là điều khoản chung áp dụng cho mọi sản phẩm, và có trước cả AI
- Ngay cả công cụ kiểm tra theo quy tắc (không phải AI) cũng đưa kết quả ra dưới dạng “vấn đề có khả năng xảy ra” chứ không phải “vi phạm đã xác định”, và đặt sẵn một bước con người phán định trong sản phẩm
- AECBench (4.800 câu · 9 mô hình LLM) — thạo ghi nhớ và hiểu, nhưng sụt rõ ở diễn giải bảng biểu, suy luận phức tạp và tính toán
- SoM-1K (1.065 bài sức bền vật liệu) — mô hình tốt nhất đạt 56,6%. Mô hình được mô tả hình vẽ bằng lời làm tốt hơn mô hình thị giác nhìn thẳng vào hình
- Cốt thép có chi phí kiểm chứng bất đối xứng — sai thì trên màn hình vẫn bình thường, đổ bê tông xong mới lộ ra
1Điều Autodesk tự ghi trong điều khoản của mình
Đó là §11.1 “Offerings are tools” trong Điều khoản chung của Autodesk (General Terms, cập nhật 30/3/2026). Đây là câu chữ nằm trong hợp đồng, không phải trên trang quảng cáo AI.
“You are solely responsible for … establishing the adequacy of independent procedures for testing the reliability, safety, accuracy, completeness, compliance with applicable legal requirements and industry standards … of any Output, including insights, recommendations, and all items designed with the assistance of the Offerings.”
Còn một điểm quan trọng nữa. Điều khoản này không phải điều khoản dành riêng cho AI. Đó là điều khoản chung áp dụng cho mọi sản phẩm (“Offerings”) của Autodesk, và đã có trước AI. Nghĩa là nó không phải hàng rào phòng thủ trước AI mà là một tuyên bố về bản chất của phần mềm thiết kế.
2Các công cụ xử lý tiêu chuẩn và quy chuẩn cũng đứng đúng chỗ đó
| Công cụ | Chức năng theo nhà cung cấp | Giới hạn theo nhà cung cấp |
|---|---|---|
| UpCodes Copilot (AI về quy chuẩn xây dựng) | “an AI-powered chatbot that allows you to ask questions and get an answer specific to your project’s parameters, year, and jurisdiction” | “It may occasionally generate incorrect information.” — câu cảnh báo duy nhất được công bố trong tài liệu hỗ trợ |
| Solibri (dựa trên quy tắc — không phải AI) | “validating Building Information Models against predefined rules … such as building codes, design guidelines, or project requirements” | Diễn đạt kết quả là “potential errors, inconsistencies, or non-compliance issues”, và đặt sẵn bước con người phán định trong sản phẩm (Making Decisions on Checking Results) |
Solibri không phải AI mà là công cụ kiểm tra theo quy tắc tất định. Vậy mà nó vẫn không gọi kết quả là “vi phạm đã xác định” mà là “vấn đề có khả năng xảy ra”, và vẫn cài bước con người phán định vào cấu trúc sản phẩm. Ngay ở vùng mà quy tắc đã rõ ràng, phán đoán cuối cùng vẫn để lại cho con người.
3Sự thật đo được — LLM làm được tới đâu với bài toán kỹ thuật
Không nói cảm tính, mà nhìn vào các bộ đánh giá đã qua bình duyệt.
| Nghiên cứu | Đối tượng | Kết quả |
|---|---|---|
| AECBench arXiv:2509.18776 (9/2025 · sửa đổi 2/2026) | Đánh giá kiến thức ngành xây dựng (AEC) theo 5 bậc nhận thức — ghi nhớ · hiểu · suy luận · tính toán · vận dụng. 4.800 câu do kỹ sư soạn và qua 2 vòng chuyên gia rà soát, 9 mô hình LLM | “a clear performance decline across five cognitive levels.” Thạo ghi nhớ và hiểu, nhưng thiếu hụt rõ ở “việc diễn giải kiến thức từ bảng biểu trong quy chuẩn xây dựng, suy luận và tính toán phức tạp, sinh tài liệu chuyên ngành” |
| SoM-1K arXiv:2509.21079 (9/2025) | 1.065 bài toán sức bền vật liệu, 8 mô hình nền | Mô hình tốt nhất đạt 56,6%. LLM được đưa phần mô tả hình vẽ do chuyên gia viết ra bằng lời giải tốt hơn mô hình thị giác nhìn thẳng vào hình — nghĩa là các mô hình hiện nay đọc sai hình vẽ kỹ thuật về mặt thị giác |
Kết quả thứ hai đặc biệt đáng chú ý, vì nó nghĩa là đọc bản vẽ vẫn là mắt xích yếu nhất.
Công bằng mà nói, cũng có nghiên cứu theo chiều ngược lại. Có nghiên cứu ghi nhận GPT-4o đạt 100% với bài toán phân tích kết cấu (arXiv:2504.09754). Nhưng đề chỉ có 20 câu, và cách làm không phải LLM tự tính mà là bắt nó viết mã Python cho OpenSeesPy, còn phần tính do bộ giải đảm nhiệm.
Gắn cho một bộ giải tất định: 100%. Bắt tự đọc hình vẽ rồi phán đoán: 56,6%.
AI chạy tốt những phép tính mà quy tắc đã được mã hóa sẵn. Việc diễn giải quy tắc để chốt giá trị thì chưa.
4Và cốt thép còn có thêm một điều kiện đặc biệt
Bảng điều khiển sai thì thấy ngay trên màn hình. Kết xuất hình ảnh lạ thì nhìn là thấy. Cốt thép sai thì đổ bê tông xong mới lộ ra.
Móc thiếu 5 độ, neo hụt một gang, mối nối đặt đúng chỗ ứng suất lớn — trên màn hình tất cả đều trông bình thường. Đây là vùng có chi phí kiểm chứng lớn một cách bất đối xứng, nên giá trị của một câu trả lời “đại khái đúng” ở đây thấp hơn các lĩnh vực khác.
Nguồn
- General Terms §11.1 · §14.2 (cập nhật 30/3/2026) — trích dẫn mạnh nhất trong loạt bàiAutodesk
- AECBench: A Multi-dimensional Benchmark for LLMs in the AEC Domain (arXiv:2509.18776)arXiv
- SoM-1K: Strength of Materials benchmark (arXiv:2509.21079)arXiv
- Integrating LLMs for Automated Structural Analysis (arXiv:2504.09754) — căn cứ theo chiều ngược lạiarXiv
- Giới thiệu Copilot (tài liệu hỗ trợ)UpCodes
- Understanding Checking — bước phán định kết quả kiểm traSolibri
Bài viết này là bản tổng hợp từ tài liệu đã công bố, không phải là giải thích pháp luật hay tư vấn. Quy định thay đổi thường xuyên, vì vậy khi áp dụng thực tế xin đối chiếu văn bản gốc và thông báo mới nhất của cơ quan có thẩm quyền.
