| BUỔI 1: CÀI ĐẶT SELENIUM VÀ WEBDRIVER — KHIẾN TRÌNH DUYỆT TỰ CHẠY THEO Ý BẠN

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:44 | 85 lượt xem

Chào mừng bạn đến với thế giới của Tự động hóa! Bạn có bao giờ mệt mỏi khi phải lặp đi lặp lại việc đăng nhập, kiểm tra giá hay tải file hàng ngày? Selenium chính là vị cứu tinh giúp bạn “điều khiển” trình duyệt thực hiện mọi thao tác đó một cách tự động 100%.


1️⃣ Selenium & WebDriver Là Gì?

Hãy tưởng tượng Selenium là bộ não, còn WebDriver là cánh tay robot trực tiếp cầm chuột và bàn phím để điều khiển Chrome, Firefox hay Edge của bạn.

[!IMPORTANT]
🚀 Bài học này nằm trong lộ trình: Khóa học Python Automation thực chiến


2️⃣ Các Bước Cài Đặt Ban Đầu

Để bắt đầu, chúng ta cần cài đặt thư viện Selenium và tải Driver tương ứng với phiên bản trình duyệt đang dùng.

  1. Cài đặt thư viện:
    bash
    pip install selenium
  2. Tải WebDriver: Ví dụ nếu dùng Chrome, bạn cần tải ChromeDriver. Hiện tại Selenium 4 đã hỗ trợ tự động quản lý Driver, giúp bạn rảnh tay hơn rất nhiều!

3️⃣ Viết Script Tự Động Hóa Đầu Tiên

Hãy thử mở Google và tìm kiếm một từ khóa bất kỳ hoàn toàn tự động nhé:

from selenium import webdriver
from selenium.webdriver.common.by import By
from selenium.webdriver.common.keys import Keys
import time

# Khởi tạo trình duyệt Chrome
driver = webdriver.Chrome()

# Truy cập trang web
driver.get("https://www.google.com")

# Tìm ô tìm kiếm và nhập nội dung
search_box = driver.find_element(By.NAME, "q")
search_box.send_keys("Hướng nghiệp Python Automation")
search_box.send_keys(Keys.RETURN)

# Chờ 5 giây để xem kết quả
time.sleep(5)

# Đóng trình duyệt
driver.quit()

TỔNG KẾT BUỔI 1

Bạn đã vừa thực hiện một bước tiến lớn: Khiến máy tính tự vận hành trình duyệt thay mình. Dù script này còn đơn giản, nhưng đây chính là nền móng để bạn xây dựng những hệ thống tự động hóa phức tạp hơn như săn sale, lấy dữ liệu hay kiểm thử phần mềm.

Hẹn gặp bạn ở buổi 2, nơi chúng ta sẽ học cách “nhắm mục tiêu” chính xác từng nút bấm trên trang web!


💡 Khởi đầu sự nghiệp tự động hóa tại: Hướng nghiệp Python – Automation

| BUỔI 16: PRESENTATION VÀ STORYTELLING — NGHỆ THUẬT KỂ CHUYỆN BẰNG DỮ LIỆU

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:19 | 99 lượt xem

Đây là buổi học cuối cùng. Bạn có thể là một chuyên gia kỹ thuật giỏi, nhưng nếu không thể truyền đạt được giá trị của dữ liệu cho sếp hay khách hàng, thì mọi phân tích đều trở nên vô nghĩa. Hôm nay, chúng ta sẽ học cách biến những con số khô khan thành những Câu chuyện (Insights) đầy sức thuyết phục.


1️⃣ Đừng Chỉ “Báo Cáo”, Hãy “Kể Chuyện”

Thay vì nói: “Doanh thu tăng 10%”, hãy nói: “Nhờ chiến dịch quảng cáo vào khung giờ vàng 19h, chúng ta đã thu hút thêm 500 khách hàng mới, giúp doanh thu tăng trưởng 10%”.

  • Context (Bối cảnh): Vấn đề chúng ta đang gặp phải là gì?
  • Conflict (Mâu thuẫn): Dữ liệu đang cho thấy điều gì bất thường?
  • Solution (Giải pháp): Chúng ta cần hành động gì để giải quyết?

2️⃣ Thiết Kế Dashboard “Biết Nói”

Một Dashboard tốt không phải là nhồi nhét thật nhiều biểu đồ. Một Dashboard tốt là chỉ tập trung vào các chỉ số KPI quan trọng nhất, giúp người xem nhìn thấy ngay vấn đề chỉ trong 5 giây.


3️⃣ Kỹ Năng Thuyết Trình Insight

Học cách trả lời các câu hỏi hóc búa từ ban lãnh đạo, bảo vệ luận điểm phân tích của mình dựa trên bằng chứng dữ liệu xác thực.


LỜI KẾT KHÓA HỌC

Chúc mừng bạn đã hoàn thành trọn bộ 16 buổi học của lộ trình Python Data Analysis. Bạn đã đi từ một người chưa biết gì đến việc có thể xử lý hàng triệu dòng dữ liệu và xây dựng những Dashboard chuyên nghiệp.

Hành trình dữ liệu là một chặng đường dài, hãy luôn giữ vững sự tò mò và tinh thần học hỏi. Chúc bạn gặt hái được nhiều thành công rực rỡ trên con đường sự nghiệp sắp tới!


🎓 Chứng nhận và hỗ trợ nghề nghiệp tại: Hướng nghiệp Python – Data Analysis

| BUỔI 15: DỰ ÁN THỰC TẾ — PHÂN TÍCH DỮ LIỆU BÁN HÀNG TỪ A-Z

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:19 | 78 lượt xem

Chúc mừng bạn đã đi đến chặng đường cuối cùng! Hôm nay không còn là những ví dụ rời rạc, chúng ta sẽ bắt tay vào một dự án thực tế: Phân tích bộ dữ liệu bán hàng của một doanh nghiệp trong 1 năm. Đây là cơ hội để bạn tổng hợp toàn bộ kỹ năng từ NumPy, Pandas đến Visualization.


1️⃣ Đề Bài & Quy Trình Xử Lý

Bạn được cấp 12 file CSV tương ứng với 12 tháng bán hàng. Nhiệm vụ của bạn là:

  1. Gộp dữ liệu: Nối 12 file thành 1 DataFrame duy nhất.
  2. Làm sạch: Xử lý giá trị trống, xóa dòng trùng, sửa kiểu dữ liệu ngày tháng.
  3. Mở rộng: Tạo thêm các cột “Thành phố”, “Giờ đặt hàng”, “Lợi nhuận”.

2️⃣ Trả Lời Các Câu Hỏi Kinh Doanh

Dữ liệu phải nói lên được giải pháp. Chúng ta sẽ cùng nhau đi tìm câu trả lời cho:

  • Doanh thu: Tháng nào có doanh thu cao nhất? Tại sao?
  • Vùng miền: Thành phố nào tiêu thụ hàng nhiều nhất?
  • Thời điểm: Giờ nào khách hàng hay đặt mua nhất? (Để tối ưu quảng cáo).
  • Sản phẩm: Cặp sản phẩm nào hay được mua cùng nhau nhất? (Để làm combo khuyến mãi).

3️⃣ Xây Dựng Báo Cáo Cuối Khóa

Sử dụng kết hợp biểu đồ Seaborn và Plotly để tạo ra một bản báo cáo hoàn chỉnh, súc tích và giàu sức thuyết phục.

TỔNG KẾT BUỔI 15

Dự án này là minh chứng cho năng lực của bạn. Khi tự tay giải quyết được bài toán này, bạn đã sẵn sàng để ứng tuyển vào các vị trí Data Analyst hoặc áp dụng trực tiếp vào công việc kinh doanh của riêng mình.


🏆 Hoàn thành dự án thực tế tại: Hướng nghiệp Python – Data Analysis

| BUỔI 13: CUSTOMIZING VÀ STYLING CHARTS — TRANG ĐIỂM CHO DỮ LIỆU

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:17 | 84 lượt xem

Một biểu đồ đúng thôi là chưa đủ, nó cần phải ĐẹpDễ hiểu. Buổi học hôm nay sẽ hướng dẫn bạn cách tùy biến màu sắc, font chữ, thêm các mốc chú thích quan trọng để biến một biểu đồ thô thành một tác phẩm nghệ thuật chuyên nghiệp.


1️⃣ Làm Chủ Màu Sắc (Color Palettes)

Màu sắc không chỉ để trang trí, nó dùng để phân loại và nhấn mạnh. Hãy học cách dùng bảng màu (Palettes) chuẩn để không gây mỏi mắt cho người xem.

  • Diverging: Dùng cho dữ liệu có điểm trung tâm (ví dụ: Lỗ – Lãi).
  • Sequential: Dùng cho dữ liệu tăng dần (ví dụ: Mật độ dân số).

2️⃣ Chú Thích Thông Minh (Annotations)

Đừng để người xem phải tự tìm xem “điểm cao nhất là bao nhiêu”. Hãy vẽ một mũi tên và ghi chú trực tiếp vào đó (Annotations). Đây là cách bạn hướng dẫn người xem đi đến kết luận nhanh nhất.

plt.annotate('Đỉnh doanh thu!', xy=(3, 200), xytext=(4, 250),
             arrowprops=dict(facecolor='black', shrink=0.05))

3️⃣ Themes & Template Chuyên Nghiệp

Sử dụng các Styles có sẵn như `ggplot`, `fivethirtyeight` hay `dark_background` để ngay lập tức có được giao diện biểu đồ như các tờ báo kinh tế hàng đầu thế giới.

TỔNG KẾT BUỔI 13

Biểu đồ chính là “bộ mặt” của người phân tích dữ liệu. Một biểu đồ được chăm chút kỹ lưỡng sẽ tạo dựng niềm tin tuyệt đối với sếp và đối tác về tính chính xác và sự chuyên nghiệp của thông tin bạn đưa ra.


✨ Nghệ thuật trình bày dữ liệu tại: Hướng nghiệp Python – Data Analysis

| BUỔI 12: PLOTLY INTERACTIVE CHARTS — ĐƯA BIỂU ĐỒ LÊN MỘT TẦM CAO MỚI

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:17 | 80 lượt xem

Nếu Matplotlib và Seaborn tạo ra các bức ảnh tĩnh, thì Plotly tạo ra những trải nghiệm tương tác. Với Plotly, người dùng có thể sờ, chạm, phóng to (zoom), thu nhỏ và di chuột để xem chi tiết từng điểm dữ liệu ngay trên trình duyệt web.


1️⃣ Biểu Đồ Tương Tác (Interactive Plots)

Plotly giúp bạn tạo ra những biểu đồ mà người xem có thể tự do khám phá. Cực kỳ phù hợp cho các báo cáo trực tuyến hoặc gửi cho khách hàng.

import plotly.express as px

# Tải dữ liệu mẫu
df = px.data.iris()

# Vẽ biểu đồ Scatter tương tác
fig = px.scatter(df, x="sepal_width", y="sepal_length", color="species",
                 title="Biểu đồ tương tác Iris với Plotly")
fig.show() # Mở trên trình duyệt

2️⃣ Đồ Họa 3D Siêu Thực (3D Visualizations)

Khi bạn có 3 biến số quan trọng và muốn xem sự tương quan giữa chúng trong không gian, biểu đồ 3D của Plotly sẽ mang lại cái nhìn trực quan nhất.

fig = px.scatter_3d(df, x='sepal_length', y='sepal_width', z='petal_width',
                    color='species')
fig.show()

3️⃣ Biểu Đồ Bản Đồ (Maps)

Plotly hỗ trợ cực tốt cho dữ liệu địa lý. Bạn có thể vẽ doanh thu theo từng tỉnh thành hoặc quốc gia trên bản đồ thế giới chỉ với tọa độ hoặc tên vùng.

TỔNG KẾT BUỔI 12

Plotly biến những con số vô tri thành một “sản phẩm công nghệ” thực thụ. Việc sử dụng biểu đồ tương tác không chỉ giúp báo cáo của bạn hiện đại hơn, mà còn cho phép người xem tự tìm ra câu trả lời cho riêng họ bằng cách thao tác trực tiếp trên dữ liệu.


🌐 Trải nghiệm tương tác dữ liệu tại: Hướng nghiệp Python – Data Analysis

| BUỔI 11: ADVANCED PLOTTING VỚI SEABORN — TRỰC QUAN HÓA THỐNG KÊ CHUYÊN NGHIỆP

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:12 | 78 lượt xem

Trong khi Matplotlib giống như một bộ cọ vẽ thủ công, thì Seaborn giống như một studio nghệ thuật hiện đại. Được xây dựng dựa trên Matplotlib, Seaborn giúp bạn tạo ra những biểu đồ thống kê cực kỳ “sang chảnh” và giàu thông tin chỉ với một vài câu lệnh đơn giản.


1️⃣ Biểu Đồ Phân Tích Mối Quan Hệ (Pair Plot)

Thay vì vẽ từng biểu đồ một, Pair Plot cho phép bạn xem mối quan hệ tương quan giữa tất cả các cặp biến số trong bộ dữ liệu chỉ bằng 1 dòng code. Cực kỳ hiệu quả cho giai đoạn khám phá dữ liệu (EDA).

import seaborn as sns
import matplotlib.pyplot as plt

# Tải dữ liệu mẫu
tips = sns.load_dataset("tips")

# Vẽ Pair Plot
sns.pairplot(tips, hue="sex", palette="Set1")
plt.show()

2️⃣ Bản Đồ Nhiệt (Heatmap) & Ma Trận Tương Quan

Bạn muốn biết những yếu tố nào ảnh hưởng mạnh nhất đến lợi nhuận? Heatmap sẽ dùng màu sắc để “nhấn mạnh” những con số này, giúp người xem nhận ra ngay lập tức các mối tương quan quan trọng.

# Tính ma trận tương quan
corr = tips.corr()

# Vẽ Heatmap
sns.heatmap(corr, annot=True, cmap='coolwarm')
plt.title("Ma trận tương quan của bộ dữ liệu Tips")
plt.show()

3️⃣ Biểu Đồ Hộp (Boxplot) Phân Loại

Seaborn làm cho Boxplot trở nên mạnh mẽ hơn bằng cách dễ dàng chia tách theo các biến phân loại (như doanh thu theo từng Ngày trong tuần hoặc theo giới tính).

TỔNG KẾT BUỔI 11

Làm chủ Seaborn giúp báo cáo của bạn trông “pro” hơn hẳn trong mắt đồng nghiệp và khách hàng. Với khả năng tích hợp sẵn các kiểm định thống kê và phối màu thông minh, Seaborn chính là trợ thủ đắc lực nhất trong chặng đường chinh phục Data Visualization.


📊 Trực quan hóa đỉnh cao tại: Hướng nghiệp Python – Data Analysis

| BUỔI 10: DATA VISUALIZATION VỚI MATPLOTLIB — VẼ BỨC TRANH DỮ LIỆU

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:07 | 75 lượt xem

“Một bức ảnh đáng giá ngàn lời nói”. Trong dữ liệu, một biểu đồ chuẩn có thể giúp sếp của bạn đưa ra quyết định chỉ trong vài giây, thay vì phải đọc hàng chục bảng Excel khô khan. Hôm nay, chúng ta sẽ làm quen với Matplotlib — “ông tổ” của các thư viện đồ họa trong Python.


1️⃣ Biểu Đồ Đường (Line Plot) & Cột (Bar Chart)

Đây là hai loại biểu đồ phổ biến nhất trong kinh doanh để theo dõi xu hướng và so sánh các nhóm dữ liệu.

  • Line Plot: Tuyệt vời để theo dõi sự thay đổi theo thời gian (ví dụ: Doanh thu theo tháng).
  • Bar Chart: Dùng để so sánh các hạng mục (ví dụ: Doanh số giữa các phòng ban).
import matplotlib.pyplot as plt

# Biểu đồ đường cơ bản
months = ['Jan', 'Feb', 'Mar', 'Apr']
sales = [100, 150, 120, 200]

plt.plot(months, sales, marker='o', color='blue')
plt.title("Doanh thu 4 tháng đầu năm")
plt.xlabel("Tháng")
plt.ylabel("Triệu VNĐ")
plt.show()

2️⃣ Biểu Đồ Phân Phối (Histogram)

Nếu bạn muốn biết: “Khách hàng của tôi chủ yếu nằm ở độ tuổi nào?”, Histogram là câu trả lời. Nó giúp bạn thấy được mật độ phân bố của dữ liệu.

ages = [20, 21, 25, 25, 25, 30, 32, 40, 45, 50]
plt.hist(ages, bins=5, color='green', edgecolor='black')
plt.title("Phân bổ độ tuổi khách hàng")
plt.show()

3️⃣ Biểu Đồ Phân Tán (Scatter Plot)

Giúp tìm ra mối quan hệ giữa hai biến số. Ví dụ: Cửa hàng có diện tích càng lớn thì doanh thu có thực sự cao hơn không?

TỔNG KẾT BUỔI 10

Matplotlib cung cấp cho bạn quyền kiểm soát tuyệt đối đến từng chi tiết nhỏ nhất của biểu đồ. Tuy nhiên, nó hơi “tốn code” một chút. Đừng lo, ở buổi tiếp theo chúng ta sẽ học Seaborn — thư viện giúp bạn vẽ biểu đồ đẹp lung linh chỉ với 1-2 dòng mã!


🎨 Nghệ thuật thị giác dữ liệu tại: Hướng nghiệp Python – Data Analysis

| BUỔI 9: DESCRIPTIVE STATISTICS — ĐỌC HIỂU CÂU CHUYỆN CỦA NHỮNG CON SỐ

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:07 | 85 lượt xem

Phân tích dữ liệu không chỉ là nhìn vào bảng biểu, mà là hiểu được bản chất của các con số. Thống kê mô tả giúp chúng ta tóm tắt toàn bộ khối dữ liệu khổng lồ thành vài chỉ số then chốt để đưa ra nhận định chính xác.


1️⃣ Chỉ Số Xu Hướng Trung Tâm (Central Tendency)

Giúp chúng ta trả lời câu hỏi: “Nhìn chung, dữ liệu đang tập trung vào đâu?”

  • Mean (Trung bình): Tổng giá trị chia cho số lượng phần tử. Rất nhạy cảm với các con số cực lớn hoặc cực nhỏ (Outliers).
  • Median (Trung vị): Con số đứng ở chính giữa danh sách khi đã sắp xếp. Trường hợp dữ liệu bị lệch, Trung vị phản ánh thực tế tốt hơn Trung bình.
  • Mode (Yếu vị): Giá trị xuất hiện nhiều nhất. Phù hợp cho dữ liệu phân loại (ví dụ: Thành phố nào bán chạy nhất?).
import pandas as pd

# Tính nhanh với Pandas
print(df['Doanh số'].mean())
print(df['Doanh số'].median())
print(df['Sản phẩm'].mode())

2️⃣ Độ Phân Tán (Dispersion)

Hai bộ dữ liệu có cùng số trung bình nhưng có thể hoàn toàn khác nhau về độ ổn định. Đó là lý do chúng ta cần đo lường sự phân tán.

  • Standard Deviation (Độ lệch chuẩn): Cho biết dữ liệu có bị “tản mát” xa khỏi số trung bình hay không. Độ lệch chuẩn thấp = dữ liệu ổn định.
  • Quartiles (Tứ phân vị): Chia dữ liệu làm 4 phần bằng nhau. Q1, Q2 (Median), Q3. Giúp xác định các giá trị bất thường (Outliers).

3️⃣ Phân Tích Outliers (Giá Trị Bất Thường)

Trong kinh doanh, một đơn hàng cực lớn đột xuất có thể làm sai lệch mọi dự báo. Bạn cần nhận diện chúng bằng Boxplot hoặc công thức IQR (Interquartile Range).

TỔNG KẾT BUỔI 9

Thống kê mô tả là lớp phòng thủ đầu tiên chống lại những ngộ nhận về dữ liệu. Việc hiểu rõ các chỉ số này sẽ giúp bạn giải thích được: “Tại sao doanh thu trung bình tháng này tăng nhưng thực tế hầu hết nhân viên lại không đạt KPI?”.


💡 Khám phá chiều sâu dữ liệu tại: Hướng nghiệp Python – Data Analysis

| BUỔI 8: GROUPBY VÀ AGGREGATIONS — SỨC MẠNH CỦA SỰ TỔNG HỢP

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:06 | 80 lượt xem

Sau khi đã dọn dẹp xong dữ liệu, giờ là lúc chúng ta đi tìm những “Insight” (thông tin giá trị). Bạn muốn biết doanh thu trung bình của từng cửa hàng? Hay số lượng đơn hàng theo từng tháng? Groupby chính là công cụ mạnh mẽ nhất để làm việc này.


1️⃣ Nguyên Lý Split – Apply – Combine

Groupby hoạt động theo 3 bước: Chia dữ liệu thành các nhóm (Split) -> Áp dụng phép toán (Apply) -> Kết hợp lại thành kết quả cuối (Combine).

import pandas as pd

# Nhóm theo 'Thành phố' và tính tổng 'Doanh số'
city_sales = df.groupby('Thành phố')['Doanh số'].sum()
print(city_sales)

2️⃣ Tính Toán Nhiều Chỉ Số (Aggregations)

Bạn không chỉ muốn tính Tổng, mà còn muốn biết cả Trung bình và Giá trị lớn nhất trong cùng một truy vấn? Hàm `.agg()` sẽ giúp bạn.

# Tính đồng thời nhiều chỉ số cho cột 'Giá' theo từng 'Loại hàng'
summary = df.groupby('Loại hàng')['Giá'].agg(['sum', 'mean', 'max'])
print(summary)

3️⃣ Pivot Tables (Bảng Tổng Hợp Chéo)

Nếu bạn đã quen với Excel Pivot Table, Pandas cũng có tính năng tương tự nhưng linh hoạt hơn rất nhiều.

# Tạo bảng so sánh doanh số giữa các 'Thành phố' và các 'Quý'
pivot = df.pivot_table(values='Doanh số', index='Thành phố', columns='Quý', aggfunc='sum')

TỔNG KẾT BUỔI 8

Groupby biến hàng triệu dòng dữ liệu chi tiết thành những con số tổng quát mang tính chiến lược. Đây là kỹ năng tối quan trọng để tạo ra các báo cáo quản trị và hiểu được xu hướng của doanh nghiệp. Chúc mừng bạn đã hoàn thành phần trọng tâm về Pandas!


💡 Khám phá bí mật dữ liệu tại: Hướng nghiệp Python – Data Analysis

| BUỔI 7: DATA CLEANING VỚI PANDAS — NGHỆ THUẬT “DỌN DẸP TRƯỚC BỮA TIỆC”

Được viết bởi thanhdt vào ngày 24/03/2026 lúc 22:06 | 80 lượt xem

Người ta thường nói: “80% công việc của một Data Analyst là dọn dẹp dữ liệu”. Dữ liệu thực tế luôn bẩn: thiếu giá trị (NaN), trùng lặp, sai kiểu định dạng. Buổi học hôm nay sẽ biến bạn thành một thợ dọn dẹp dữ liệu chuyên nghiệp.


1️⃣ Xử Lý Dữ Liệu Thiếu (Missing Data)

Khi một bảng dữ liệu có những ô trống (NaN), bạn có hai lựa chọn: Xóa bỏ hoặc Lấp đầy.

# Kiểm tra số lượng giá trị thiếu
print(df.isnull().sum())

# Lựa chọn 1: Xóa toàn bộ dòng có dữ liệu thiếu
df_clean = df.dropna()

# Lựa chọn 2: Lấp đầy bằng giá trị trung bình (Hoặc số 0)
df['Tuổi'] = df['Tuổi'].fillna(df['Tuổi'].mean())

2️⃣ Dữ Liệu Trùng Lặp (Duplicates)

Dữ liệu rác (do nhập lỗi hoặc lỗi hệ thống) thường bị lặp lại nhiều lần. Hãy loại bỏ chúng để đảm bảo tính chính xác cho các thống kê sau này.

# Xem có bao nhiêu dòng bị trùng
print(df.duplicated().sum())

# Xóa các dòng trùng lặp, chỉ giữ lại dòng đầu tiên
df = df.drop_duplicates()

3️⃣ Chuyển Đổi Kiểu Dữ Liệu (Type Conversion)

Đôi khi giá số bị lưu ở dạng chuỗi văn bản, khiến bạn không thể tính toán sum hay mean. Chúng ta cần ép kiểu cho chúng.

# Chuyển cột 'Giá' từ Object (String) sang Float
df['Giá'] = df['Giá'].astype(float)

# Chuyển cột 'Ngày' sang định dạng DateTime chuẩn
df['Ngày'] = pd.to_datetime(df['Ngày'])

TỔNG KẾT BUỔI 7

“Garbage in, Garbage out” — Nếu bạn đưa dữ liệu rác vào mô hình, bạn sẽ nhận được kết quả rác. Kỹ năng dọn dẹp dữ liệu là sự khác biệt giữa một người am nghiệp và một chuyên gia phân tích thực thụ. Hãy luôn kiểm tra và làm sạch dữ liệu trước khi bắt đầu bất kỳ phân tích nào!


💡 Làm chủ dữ liệu thực chiến tại: Hướng nghiệp Python – Data Analysis