Research prototype
方法、数据与局限
想看笑话回地图。这一页是坦白从宽。本项目是 Chetty, Friedman, Hendren, Jones & Porter 《The Opportunity Atlas》的城市区级原型,用作数据驱动建模与可视化的公开证明。
为什么不是「官方机会地图」
美国 Opportunity Atlas 依赖 IRS 与 Census 把约两千万名 1978–1983 年出生者回链到他们长大的普查小区(tract),直接估计「在此长大的孩子 35 岁收入」。中国没有公开发布这种父母—子女行政追踪微数据,街道或小区级的长期收入更不可得。
因此本图不声称复制了 Chetty 的识别策略。它把可公开观察的区级特征,通过一篇结构映射,变成与 Opportunity Atlas 相同的交互问题:若一个孩子在该区长大、父母处于某收入分位,35 岁时家庭收入大概在哪。
模型
邻里质量指数(0–1)为加权和:
Q = 0.28·学校 + 0.16·高校人力资本 + 0.16·低收入反向 + 0.12·收入混合 + 0.12·高技能岗位 + 0.08·非本地入学包容 + 0.08·通勤可达
权重贴近 Opportunity Atlas 的相关事实:学校与贫困是最稳的预测项;「包容」是中国户籍/学区制度的对应项。
子女在全国城镇 35 岁收入分布中的分位:
R = 50 + ρ_city (p − 50) + α · θ(p) (Q − 0.5)·100 + γ_g θ(p) = 0.22 + 0.28 (1 − p/100) α ∈ [0, 1] 未识别(没有搬家者)
ρ 为城市级代际收入秩相关,校准到 CFPS/CHIP 文献中的城镇 IGE(约 0.40–0.46)。θ(p) 随父母收入下降而增大——这是 Chetty 的核心发现:邻里对低收入家庭的孩子更重要。
把 R 通过城市特异的对数正态分布 F−1转成 35 岁家庭收入。页面上只报区间,来自权重 ±60% 与文献 ρ ∈ [0.34, 0.56](切蒂美国秩相关下界,中国城镇 IGE 上界)的集合。 高等教育入学、进入最高五分位、住房自有率由 Q 与 p 的 logistic 给出;自有率额外扣减高房价区对低收入孩子的挤出。
结构层多一个未识别参数 α ∈ [0,1]:邻里差距有多少是因果。α = 0 是纯选择,全市一色;α = 1 是满映射。没有搬家者,α 钉不住,滑条只是在识别集合里选一条射线。
「搬入实验」采用 Chetty–Hendren 的童年暴露折算:从本市最低机会区迁入,差距的吸收份额 ≈ (18 − 搬入年龄)/18。
数据
- 联合国《2025 年世界城市化展望》里人口过 1000 万的 33 座城镇,原来没有的 26 座补进来了:东京、德里、雅加达、达卡、首尔、开罗、马尼拉、孟买、圣保罗、拉各斯、伦敦这些。边界是公开行政区,不是小区。颜色按公开的贫富方位估,同一套色在上海和在金沙萨不是同一套精度。不是孩子税单。
- 重庆 38 个区县:城镇人均可支配收入是 2023 年全市分区表。分数仍是公开格局,不是孩子税单。綦江的图含万盛,年鉴把万盛单列,两套对不齐。彭水那一格没从公开表对上,收入是按邻县估的。
- 什邡:公开文件只有整座县级市的边界,没有乡镇红线。图上 10 片是按市界和大致方位切的。人口是 2020 年普查(皂角后来改名雍城)。收入没有分镇公报,是全市城镇大约 5 万这一档,再按平原和山区挪的。
- 青城山:都江堰市青城山镇,不是另一座市。界是公开乡镇轮廓,不是民政红线原件。2020 年普查约 9.7 万人,城镇约 3.6 万。收入没有分镇公报。成灌铁路有青城山站,都江堰中学不在山上。
- 海淀、徐汇、武侯,以及西柏林两个富人区(夏洛滕堡-威尔默斯多夫、施泰格利茨-策伦多夫),拆到街道或地段。界是公开轮廓,贴在原来的区界里,不是民政红线原件。人口:三个区是 2020 年普查,西柏林是 2025 年底登记册。收入没有街道公报,仍是原来那一区的数字,按高校、景区、镇、别墅这些公开功能差开。中关村不是温泉镇,格鲁内瓦尔德不是夏洛滕堡北。武侯这张图的南边有四块由高新区代管(桂溪、芳草街、肖家河、石羊),区界还罩着它们。
- 金牛、天府直管区、黄浦、静安拆到街道。人口是 2020 年普查。天府各街道按直管区公布的比重还原,有四舍五入。收入不是街道公报。籍田大部分在现有天府轮廓外面,没有硬画进去。香港十八区拆成 2019 年区议会选区,不是 2023 年改过的那一版。人口按面积把全区普查人数摊开,不是选区人口。名字里有邨、而且不是新邨的往下挪;山顶、半山、司徒拔、宝马山、京士柏、九龙塘、何文田往上挪。浅水湾、深水湾、寿臣山、毕架山没有单独的 2019 选区名字,所以没有单独抬。不是选区调查。山顶那一格面积很大,按面积摊人会把中环的收入往下挤。这不是中环更穷。
- 台北、新北、桃园、台中、台南、高雄:乡镇市区边界。分数按收入、学校和岗位的公开格局编码,不是税档亲子追踪。收入按新台币家庭年收入计。
- 纽约、旧金山是公开街区边界。瓦列霍没有现成街区文件,是按市界切成 8 片常用地区。波士顿图把剑桥补了进来(剑桥是另一座市,所以原来的波士顿图里没有),按市界切成东剑桥、中剑桥、北剑桥、哈佛广场等片,不是剑桥市政府的官方街区文件。
- 柏林其余仍是 12 个区里没拆的那些。洛杉矶社区:公开区划。分数同样是编的,不是 IRS 或德国税档。
- 2026 世界杯举办城市补了进来:西雅图、费城、亚特兰大、迈阿密、休斯顿、达拉斯、堪萨斯城、多伦多、温哥华、墨西哥城、瓜达拉哈拉、蒙特雷,外加硅谷(李维斯球场在圣克拉拉,不在旧金山市区)。分数仍是公开格局的方向,不是税单。球场有的在图里,有的在隔壁市,城市说明里写了,不假装多边形把球场包住。
- 收入:内地用人均可支配收入;香港用住户月入;台湾用家庭年收入(新台币);美国用美元家庭收入;加拿大用加元家庭收入;墨西哥用比索家庭收入;柏林用欧元家庭收入。颜色只比这座城市内部,不按购买力把它们拉成同一种钱。
- 学校、岗位、外地孩子能不能入学:按公开口碑和产业编的 0–100 分,不是普查微观记录。
被标记为 compiled 的单元格不是普查微观记录,而是由相邻公开序列外推。香港十八区的住户月入是普查,拆开以后每一格不是选区调查。
如何绕过「没有税档」
最大的限制绕不开。能做的是把网站从「假装有切蒂的点估计」改成四件可核对的对象:
- 公开数字:把学校、工作、地铁这些公开数字合成一个街区分数。它不跟父母收入滑条走——那一步算不出来。
- 比房价更值:在同一座城市里,把街区分数里「只是因为有钱」的部分扣掉。正的是西雅图北郊那种「不是最贵、但对孩子更好」;负的是很贵但没有额外的好。
- 搬家后可能落在的范围:没有真的搬家家庭,就不能说「搬了就涨多少」。能说的是一个范围:最少是白搬,最多是孩子还剩的童年 × 两地差距。美国研究里每年大约 1/18 的经验标在旁边,那不是中国的估计。
- 学籍要等多久:美国搬到就能上学。中国积分入学会拖一段时间,这段时间里学校分按开放程度打折。等得太久,美国那条经验会高过中国实际上限。
- 最好的一项和最差的一项:中小学、工作、地铁这些在本市各自排名。差得很远时,地图打斜线,表示这个分数是拼的。旋钮页可以看到权重一改,名次变不变。
天府新区直管区(兴隆湖 / 科学城)补进成都图层,避免把科学城小学、七中育才科学城分校揉进双流中位。拆开以后,高分在兴隆,不在华阳,更不在籍田。
局限(请写进申请材料)
- 没有真的搬家家庭,不能把颜色读成「搬到这里孩子就会怎样」。
- 区太大。浦东、朝阳、龙岗内部的差别,可能比区与区之间还大。
- 现在的收入已经把人筛过一遍:贵的区里,穷家庭本来就少。
- 男女差距是一个全市的校正,不是每个区单独测出来的。
- 货币不一样:内地人民币,香港港元,台湾新台币,柏林欧元,美国美元,加拿大加元,墨西哥比索。颜色比的是这座城市内部的相对位置,不按购买力把它们拉成同一个钱。
文献
- Chetty, Friedman, Hendren, Jones, Porter. The Opportunity Atlas. AER, 2026.
- Chetty & Hendren. The Impacts of Neighborhoods on Intergenerational Mobility. QJE, 2018.
- Fan, Yi, Zhang 等关于中国代际流动的 CFPS/CHIP 估计。
- Hong, Gruijters. 中国代际教育流动的地理. Population, Space and Place, 2024.