روششناسی در بخش داده
چطور دادههای اقتصادی ایران را یکپارچه و قابلاعتماد میکنیم؟
نخستین مقاله از مجموعهٔ «متدولوژیهای فرمانا»
دادههای اقتصادی و اجتماعی ایران پراکندهاند و از نظر ساختار انتشار دائما در حال تغییرند. در فرمانا هدف ما این است: هر داده یک بار، درست، و روی یک قالبِ مشترک آماده شود؛ تا تحلیل، مقایسه و بهروزرسانی بهجای هفتهها، در چند لحظه ممکن باشد. این مقاله توضیح میدهد چطور این کار را چطور انجام میدهیم.
دو خروجی برای هر مجموعهداده
هر مجموعهداده در فرمانا دو نسخه دارد:
نسخهٔ غنی (mart): همهٔ جزئیاتِ اصلیِ منبع — مثلاً در تجارت، تفکیک بر اساس کد کالا، کشور و
گمرک؛ در حسابهای ملی، ارزشافزودهٔ هر بخشِ اقتصادی. این نسخه برای تحلیلِ عمیق است.نسخهٔ هماهنگ (observations): یک لایهٔ متمرکز و یکدست که در آن هر ردیف، یک مقدار است با
زمان، مکان، واحد و منبعِ مشخص. این همان چسبی است که مجموعهدادههای مختلف را کنار هم مینشاند؛
چون همه از یک قالب پیروی میکنند، تورم و تجارت و بورس روی یک محور جمعشدنی میشوند.
پنج ستونِ مشترک
برای اینکه دادهها واقعاً کنار هم بنشینند، در حال حاضر پنج «ستونفقرات» ثابت داریم که همهٔ مجموعهدادهها از
آنها استفاده میکنند:
زمان — تاریخِ شمسیِ استاندارد (سالانه، فصلی، ماهانه یا روزانه).
مکان — کدهای رسمیِ تقسیمات کشوری (ملی، استان، شهرستان) و برای دادههای بینالمللی، کدهای
استانداردِ کشورها. کدها را هرگز خودمان نمیسازیم؛ از مرجعِ رسمی میآیند.واحد — از فهرستی ثابت (ریال، دلار، درصد، تن، …) تا هیچ عددی بیواحد نماند.
منبع — مرجعِ هر داده صریح ثبت میشود؛ چون از کجا آمدنِ داده بهاندازهٔ خودِ عدد مهم است.
بانک شاخص — فهرستی از همهٔ شاخصهایی که میسنجیم، همراه با معنا و ویژگیهایشان.
چند منبع برای یک حقیقت
یکی از تصمیمهای کلیدیِ ما این است که وقتی یک موضوع را چند مرجع گزارش میکنند، آنها را در هم نمیآمیزیم. منابع مختلف آماری هرکدام روش و سبدِ خودشان را دارند؛ تفاوتشان یک اشکال نیست، یک ویژگی است — به ما اجازه میدهد اعداد را راستیآزمایی کنیم و اختلافِ روشها را ببینیم.
به همین دلیل هر منبع سریِ مستقلِ خودش را دارد، و در کنارشان یک نمای یکپارچه که یکی را بهعنوان مرجعِ پیشفرض معرفی میکند.
چرا «چطور جمع میشود» مهم است
همهٔ اعداد مثلِ هم رفتار نمیکنند. صادرات را میشود روی ماهها جمع زد تا رقمِ سالانه بهدست آید؛
اما ضریب جینی یا شاخص قیمت را نمیشود جمع زد یا میانگینِ ساده گرفت — بیمعنی میشود. برای همین
برای هر شاخص ثبت میکنیم که آیا جمعپذیر است، میانگینِ وزنی میخواهد، یا اصلاً
ناجمعپذیر است. این یک قاعدهٔ ساده اما حیاتی است که جلوی خطاهای خاموشِ تحلیلی (به صورت ویژه استخراج و تحلیل ماشینی) را میگیرد.
دروازههای کیفیت
داده در مسیرِ خود از چند «دروازه» عبور میکند و هیچچیز بیصدا رد نمیشود:
راستیآزمایی: جمعِ اجزا باید با رقمِ کلِ منبع بخواند (مثلاً مجموعِ ارزشافزودهٔ بخشها باید
برابرِ تولید ناخالص داخلی باشد).مقایسه با منبع: دادهٔ در دست را با نسخهٔ رسمیِ روز میسنجیم — چون «موجود بودن» بهمعنای
«درست و بهروز بودن» نیست.پرچمِ ناهنجاری: پرشهای مشکوک پیش از انتشار بررسی میشوند تا خطای منبع از رویدادِ واقعی
تفکیک شود.
نتیجه
خروجیِ این فرایند مجموعهای از دادههاست که هم عمیقاند و هم با هم سازگار: از تورم و تولید ناخالص
داخلی تا شاخص بورس و قیمتهای جهانیِ کالا — همه روی یک قالب، با منبعِ شفاف و کیفیتِ سنجیده. این
زیربنایی است که تحلیلها، داشبوردها و مقایسههای بعدیِ فرمانا روی آن ساخته میشوند.
این دادهها بهصورت باز روی صفحهٔ فرمانا در Hugging Face در دسترساند.