Bắt đầu ngayBắt đầu miễn phí

Nhận diện nguồn dữ liệu không đáng tin cậy

Nhóm của bạn đang phát triển một mô hình hỗ trợ tạo báo cáo chính xác trong ngành an toàn ô tô. Bạn đã thu thập dữ liệu sở thích từ ba nguồn dữ liệu — "GlobalDrive Safety Institute", "AutoTech Safety Alliance" và "QuickScan Auto Review". Gần đây, có những lo ngại về tính toàn vẹn của dữ liệu, và bạn được yêu cầu đánh giá để xác định bất kỳ nguồn dữ liệu nào không đáng tin cậy.

automotive_df là một DataFrame tổng hợp được nạp bằng thư viện pandas đã nhập sẵn. Nó chứa dữ liệu từ cả ba nguồn. Hàm majority_vote đã nhập sẵn tạo ra một đối tượng giống từ điển với cặp (chosen, rejected) theo đa số cho mỗi 'id'.

Bài tập này là một phần của khóa học

Reinforcement Learning from Human Feedback (RLHF)

Xem khóa học

Hướng dẫn bài tập

  • Xác định điều kiện để đếm một trường hợp bất đồng với kết quả bỏ phiếu đa số cho một nguồn dữ liệu nhất định.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

def detect_unreliable_source(merged_df):
    df_majority = df.groupby('id').apply(majority_vote)
    disagreements = {source: 0 for source in df['source'].unique()}
    for _, row in df.iterrows():
        # Condition to find a disagreement with majority vote
        ____
    unreliable_source = max(disagreements, key=disagreements.get)
    return unreliable_source

disagreement = detect_unreliable_source(automotive_df)
print("Unreliable Source:", disagreement)
Chỉnh sửa và Chạy Mã