行业代码映射清洗
国内价值链GVC测算原始数据+清洗程序+测算代码+测算结果+文档 众鲤数据网
国内产业链的拆解就像玩拼图——原始数据是满地的碎片,清洗程序是挑出有用的零件,测算代码就是按图索骥的拼装说明书。咱们今天手把手把这套流程走通,顺便聊聊实操中的那些骚操作。
数据这玩意儿刚拿到手时绝对让人头大。解压包里的industrycodemapping.xlsx藏着行业分类的密码,打开一看:C13农副食品加工业、C17纺织业…这串字母数字组合活脱脱摩斯电码。处理行业关联得先搞定标准化,上Python的pandas准没错:
mapping = pd.read_excel('industry_code_mapping.xlsx') mapping['GB2002'] = mapping['GB2002'].str.extract('(\d+)')[0].str.zfill(4) mapping.dropna(subset=['IO2002'], inplace=True) print(mapping.sample(3))这段代码干了两件关键事:把行业代码统一成4位数格式(比如把13补成0013),然后踢掉映射关系不全的孤儿数据。注意那个zfill(4),当年我在这个坑里栽过跟头——有些代码开头带0,用int转换直接归西,必须保留字符串格式。
国内价值链GVC测算原始数据+清洗程序+测算代码+测算结果+文档 众鲤数据网
投入产出表才是重头戏,CSV文件里密密麻麻的数值看得人眼晕。Stata处理这种矩阵数据最顺手:
// 上游度指数计算 use IO_Table.dta, clear merge 1:1 industry using GVCMetrics.dta egen upstream = rowtotal(F*), missing replace upstream = upstream / total_output if !missing(total_output) xtile gvc_rank = upstream, nq(5)这段代码藏着三个彩蛋:1)merge时自动过滤非匹配项 2)rowtotal带missing参数防漏 3)分位数排名直接生成梯队。注意total_output为0的行业会出幺蛾子,实战中得加个if过滤。
跑完代码别急着嗨,check结果是否反常识。某次跑出"水的生产供应业"称霸上游度,细查发现行业归类时把输水管网算作了中间投入。这时候得回炉重造映射表,在行业注释文档里追加备注:
/* 特别处理 */ - C46水生产和供应业:剔除管网基础设施部分 - C39计算机通信业:合并软件服务细分项最后成型的GVC指标csv,用PowerBI拉个动态热力图最直观。颜色越红的行业像磁铁一样吸附在产业链上游,你会发现电子元器件这类闷声发财的行业才是隐形冠军。附上完整代码的Git仓库时,千万别忘了加个版本说明——毕竟投入产出表隔几年就变脸,2024年用的参数到2025年可能就成毒药了。
这套方法论的商业价值在于定位产业链卡脖子环节,比如当某行业的上游度突然飙升,可能是技术封锁的前兆。不过要小心数据滞后性,去年爆雷的某新能源企业,GVC指标完美却倒在现金流上,这提醒我们:数值再漂亮,也得接地气。
