📰 来源:Towards Data Science | 📅 翻译日期:2026年7月2日
🔗 原文:查看原文
🤖 翻译:DeepSeek AI · 仅供参考
评估框架的关键性
本讨论的第一部分[1]探讨了当评估设置存在缺陷时,强大的机器学习如何可能显得极具说服力。然而,在空间预测问题中,例如涉及资本收益估算、租金预测或价格预测的房地产应用,问题并不仅仅在于修复时间泄漏。即使时间处理得当,如果忽略空间依赖性、重复资产结构和区域覆盖不均,模型仍然可能表现得比实际情况好得多。在这些场景中,最难的部分通常不是拟合灵活的模型,而是设计一个评估框架,告诉我们模型是否真正泛化到了它从未见过的社区、资产类型和市场细分区域。
空间数据的重要性
空间数据在指导可持续倡议方面扮演着越来越重要的角色。地理信息不仅可以用于评估房地产价值,还可以评估城市规划和基础设施投资的领土脆弱性,优化物流和移动服务,改善可达性,以及估算保险风险以帮助防止重大灾害损失等。在这些背景下,地理不仅是另一个特征,它塑造了结果产生的运营和经济环境。
空间数据的特殊性
空间数据不像普通的独立行那样组织。它带有几何、邻近、邻接和依赖性。附近的地方往往比远距离的地方行为更相似,这一想法通常由 Tobler 地理学第一定律概括:所有事物都与其他事物相关,但邻近的事物比远距离的事物更相关[2]。因此,在这些情况下,建模问题发生了变化。训练和测试样本不再独立,重复的地理单元可能使预测看起来比真正的泛化更容易,而不均匀的覆盖可能使模型看起来可靠,仅仅是因为它是在密集、观察良好的区域上进行评估的。
尽管在实践中,AutoML 和代码代理[3, 4]现在可以自动化工作流程的大部分,但最难的部分仍然是人类:理解空间依赖性、面板结构和覆盖如何影响结果的可信度。
空间陷阱
总之,本文的目标是提供关于最常见的使模型看起来比实际情况更具泛化能力的方法论问题的实用指南:
- 邻近性和持续性陷阱:模型可能在新数据上表现良好,实际上却受益于数据中已经存在的空间邻近性、时间持续性或熟悉的市场条件。这会影响依赖于独立性假设的训练、交叉验证和参数调整过程。
- 覆盖幻觉:当整体表现由大而密集且观察良好的区域驱动时,稀疏覆盖的区域仍未被很好理解和预测。
- 边界幻觉:当模型质量严重依赖于地理如何划分、分组或编码时,尽管这些边界往往是行政便利而非经济现实。
- 地理偏见:空间变量可能看起来高度预测,同时默默编码着贫困、机会不平等或长期存在的隔离模式,这可能导致模型即使没有明确包含受保护属性,也会强化排斥性结果。
- 特征价格简化:当可见的房产属性被视为足以解释价值时。在住房估值中,阳台、露台、便利设施、大小或可达性等特征可能捕捉到有用的价格信号,但它们并不能完全解释市场。稀缺性、法规、信贷条件、收入、就业和供应限制可能主导个人偏好,尤其是在受限的市场中。
- 默默维护税:当一个有前景的模型在面对真实市场条件时,监控、验证、更新、演变和防御的长期负担被隐藏起来。
随着空间数据在许多应用中变得越来越有价值,本文旨在列出这类设置中可能出现的一些问题。这不是一个详尽的列表。关于不同问题设置中机器学习陷阱的更全面回顾,请参见[5];对此具体背景之外的相关建模问题的更广泛讨论,请参见前一篇文章[1]。
图1. 本文介绍的六种空间机器学习陷阱的概念图。由 DALL·E 生成的 AI 插图。
邻近性和持续性陷阱
一个好的模型不仅应该表现良好;它应该改进数据中已经存在的结构。换句话说,它应该击败正确的基线。在空间问题中,这意味着一个有意义的基线应该捕捉到 Tobler 论点已经提出的至少两个基本机制:持续性(未来往往与过去相似)和空间自相关(附近的地方往往比远距离的地方行为更相似)。
对于房地产、租金或资本收益预测,这意味着一个模型可能看起来强大,仅仅因为昂贵的地区往往保持昂贵,密集的市场保持密集,邻近的资产共享相似的经济和空间条件。
在这种情况下,一个弱基线(如预测全局均值)可能使模型看起来令人印象深刻,即使它只是在利用基本的空间记忆。更有意义的基线应该捕捉可用的信息,例如同一区域的先前值、邻域的历史平均值、附近房产的平均值、季节性朴素预测、简单的特征价格回归或基本的空间插值方法。这些基线旨在代表任何严肃的空间模型都应改进的最小结构。
就像所选的基线一样,
参考资料
[1] 为什么强大的ML会欺骗性地简单——第一部分
[2] Tobler, W. R. (1970). 地理学第一定律。
[3] 代码代理相关工作
[4] AutoML 相关工作
[5] 不同问题设置中机器学习陷阱的全面回顾
评论已关闭