10个Shapiq入门示例:从表格数据到图像识别的可解释性分析
10个Shapiq入门示例:从表格数据到图像识别的可解释性分析
【免费下载链接】shapiqShapley Interactions and Shapley Values for Machine Learning项目地址: https://gitcode.com/gh_mirrors/sh/shapiq
Shapiq是一个强大的机器学习可解释性工具,专注于提供Shapley交互值和Shapley值计算。无论是处理表格数据、构建树模型,还是进行图像识别,Shapiq都能帮助你深入理解模型决策过程,揭示特征之间的复杂关系。本文将通过10个实用示例,带你快速掌握Shapiq的核心功能和应用方法。
1. 安装与环境配置
开始使用Shapiq前,需要先进行安装。最简单的方法是通过pip安装:
pip install shapiq如果你需要从源代码构建,可以克隆仓库并进行本地安装:
git clone https://gitcode.com/gh_mirrors/sh/shapiq cd shapiq pip install .Shapiq的核心功能模块位于src/shapiq/目录下,包含了各种解释器、近似算法和可视化工具。
2. 表格数据基础解释:房价预测分析
表格数据是机器学习中最常见的数据类型,Shapiq提供了丰富的工具来解释这类数据上训练的模型。以加州房价预测为例,我们可以使用Shapiq分析各个特征对房价的影响。
上图展示了使用Shapley值解释房价预测的结果。从图中可以看出,房屋年龄(House)和平均房间数(AveRo)对房价有显著的正向影响,而经度(Longi)则有负向影响。这个示例展示了Shapiq如何帮助我们理解单个特征对模型预测的贡献。
相关代码示例可以在examples/tabular/目录下找到,特别是plot_shapiq_scikit_learn.py文件,详细演示了如何使用Shapiq解释scikit-learn模型。
3. 特征交互分析:位置因素对房价的影响
除了单个特征的影响,Shapiq还能揭示特征之间的交互作用。在房价预测中,纬度和经度的交互作用对房价有显著影响。
上图展示了Shapley交互值的分析结果,其中纬度(Latit)和经度(Longi)的交互项(Latit. x Longi.)对房价有明显的正向影响。这表明,房屋的位置(经纬度组合)比单独的纬度或经度更能决定房价。
要进行特征交互分析,可以在创建解释器时设置max_order=2,如下所示:
from shapiq import Explainer explainer = Explainer(model, data=X, max_order=2) interaction_values = explainer.explain(X[0], budget=1024)4. 树模型解释:LightGBM模型的特征重要性
树模型(如LightGBM、XGBoost)在机器学习竞赛中表现优异,但它们的决策过程往往难以解释。Shapiq提供了专门的树模型解释器,能够高效地计算树模型的Shapley值和交互值。
如上图所示,Shapiq的Tree Explainer模块专门用于解释树模型。你可以使用以下代码初始化树模型解释器:
from shapiq import TreeExplainer explainer = TreeExplainer(model) shap_values = explainer.shap_values(X)相关示例可以在examples/trees/目录下找到,特别是plot_treeshapiq_lightgbm.py文件。
5. 图像识别解释:狐狸图像分类
Shapiq不仅适用于表格数据,还能解释计算机视觉模型的决策过程。以图像分类为例,Shapiq可以识别出对分类结果贡献最大的图像区域。
上图展示了Shapiq对"红狐"图像分类的解释。图中红色节点表示对分类有正向贡献的图像区域,蓝色节点表示负向贡献。可以看到,狐狸的眼睛、耳朵和面部区域对"红狐"分类有显著的正向影响。
相关代码示例可以在examples/vision/目录下找到,特别是plot_vision_transformer.py文件。
6. 文本情感分析:电影评论情感预测
自然语言处理模型的决策过程同样可以用Shapiq来解释。以情感分析为例,Shapiq可以识别出对情感预测贡献最大的词语或短语。
虽然没有直接的图片展示文本解释结果,但你可以使用以下代码来解释文本分类模型:
from shapiq import TextExplainer explainer = TextExplainer(model) explanation = explainer.explain("This movie is amazing!")相关示例可以在examples/language/目录下找到,特别是plot_sentiment_analysis.py文件。
7. 数据估值:特征重要性评估
在机器学习中,了解哪些特征对模型性能最重要是很有价值的。Shapiq可以通过计算特征的Shapley值来评估特征的重要性,帮助我们进行特征选择。
上图展示了一个特征交互热力图,显示了不同特征组合的交互值大小。这有助于我们识别出对模型预测最重要的特征组合。
要进行数据估值,可以使用以下代码:
from shapiq import Explainer explainer = Explainer(model, class_index=y_explain_pred, index="SV", max_order=1)相关示例可以在examples/nearest_neighbor/目录下找到,特别是plot_nn_data_valuation.py文件。
8. 模型比较:不同算法的解释结果对比
Shapiq可以用于比较不同模型的解释结果,帮助我们理解模型之间的差异。例如,我们可以比较线性回归和随机森林对同一数据集的解释结果。
上图展示了不同阶数的n-SII值(Shapley交互指数),可以用于比较不同模型对特征交互的捕捉能力。
要比较不同模型的解释结果,可以使用Shapiq的基准测试模块,位于src/shapiq_benchmark/目录下。
9. 高维数据解释:基因表达数据分析
高维数据(如基因表达数据)的解释是一个挑战,Shapiq提供了稀疏近似算法,可以高效地处理高维数据。
from shapiq.approximator.sparse import Spex approximator = Spex(game=game, budget=1000) interaction_values = approximator.approximate()相关示例可以在examples/approximators/目录下找到,特别是plot_spex.py文件。
10. 自定义游戏:创建你自己的解释问题
Shapiq的灵活性允许你定义自己的"游戏"(即要解释的问题)。例如,你可以定义一个自定义的价值函数来评估特征子集的重要性。
import shapiq class CountGame(shapiq.Game): def __init__(self, n_players): super().__init__(n_players=n_players) def value_function(self, coalitions): return np.sum(coalitions, axis=1)这个示例创建了一个简单的游戏,其中特征子集的价值是子集中特征的数量。你可以根据自己的需求定义更复杂的价值函数。
总结
Shapiq是一个功能强大的机器学习可解释性工具,提供了从简单到复杂的各种解释方法。通过本文介绍的10个示例,你可以看到Shapiq在不同数据类型(表格、图像、文本)和不同模型(树模型、神经网络、线性模型)上的应用。
无论你是机器学习初学者还是资深从业者,Shapiq都能帮助你更好地理解模型决策过程,提高模型的透明度和可信度。开始使用Shapiq,探索机器学习的"黑箱"内部吧!
更多详细文档和示例可以在docs/目录下找到,特别是docs/source/introduction/目录中的入门指南。
【免费下载链接】shapiqShapley Interactions and Shapley Values for Machine Learning项目地址: https://gitcode.com/gh_mirrors/sh/shapiq
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
