vs code扩展应通过官方市场安装parquet viewer for vs code(id: phoebus-parquet.parquet-viewer),认准发布者phoebus;文件须以.parquet结尾,右键选择“reopen with parquet viewer”;仅支持简单where过滤,不支持join、函数、嵌套字段直接引用及通配符开头的like。

VS Code扩展怎么装:别碰parquet-viewer主项目仓库
VS Code 的 Parquet Viewer 扩展和浏览器版/桌面版的 parquet-viewer 是两个独立项目,不能直接用主仓库代码安装。你看到的 vscode-extension/ 目录只是源码子模块,不是 VS Code 可识别的扩展包。
正确做法是去 VS Code 官方扩展市场搜索「Parquet Viewer」——目前唯一上架且持续维护的是由同一作者发布的 Parquet Viewer for VS Code(ID: phoebus-parquet.parquet-viewer)。
- 打开 VS Code → 点击左侧扩展图标(或按
Ctrl+Shift+X) - 在搜索框输入
Parquet Viewer,认准发布者为Phoebus - 点击「Install」,安装后无需重启,直接生效
- 不推荐手动下载
.vsix或从源码编译,因为缺少package.json入口声明和签名,VS Code 会拒绝加载
打开Parquet文件时为什么显示“Unsupported file format”
这个错误不是文件损坏,而是 VS Code 扩展对 Parquet 文件的识别依赖于文件后缀和 MIME 类型双重校验。它只认 .parquet,不接受 .pq、.snappy.parquet 或无后缀的二进制文件。
- 确保你的文件名以
.parquet结尾(例如sales_2024.parquet) - 如果文件来自 Spark/Hive 输出,可能带压缩后缀如
_SUCCESS或.snappy,需重命名为纯.parquet - 右键文件 → 「Reopen with Parquet Viewer」,而不是双击默认打开;双击可能被 VS Code 当作二进制流拦截
- 首次打开大文件(>500MB)时会有短暂延迟,状态栏显示「Loading schema…」,此时不要关闭面板
查询功能怎么写WHERE条件:语法和限制必须清楚
VS Code 版不走 DataFusion 引擎,用的是轻量级 Rust 解析器,SQL 支持非常有限。它只支持单表 WHERE 过滤,不支持 JOIN、GROUP BY、子查询或函数调用(比如 DATE()、CAST())。
- 合法写法:
WHERE user_id > 1000 AND status = 'active' - 非法写法:
WHERE DATE(created_at) = '2024-01-01'(DATE()不支持) - 时间字段只能用原始字符串比较:
WHERE created_at >= '2024-01-01T00:00:00' - 字符串模糊匹配仅支持
LIKE,但不支持通配符开头:WHERE name LIKE 'John%'✅,WHERE name LIKE '%ohn'❌(会报错) - 嵌套字段(如
user.address.city)无法直接引用,需先展开结构再筛选
为什么嵌套字段显示为[object Object]或空值
VS Code 扩展对 Parquet 的嵌套类型(LIST、MAP、STRUCT)不做自动扁平化,只做 JSON 序列化展示。它不会像桌面版那样递归展开层级,也不会渲染预览缩略图。
- 遇到
[object Object],说明该列是STRUCT类型,可右键该单元格 → 「Copy as JSON」粘贴到编辑器里看完整结构 -
LIST字段会显示为数组 JSON 字符串,如["a", "b", "c"],但无法在 WHERE 中用IN查询 - 如果字段含
NULL值,且类型为DECIMAL或UUID,可能因精度丢失显示为空白——这是 VS Code 渲染层的已知限制,不是数据问题 - 真正要分析嵌套结构,建议导出为 CSV 后用 Pandas 或切回桌面版
ParquetViewer.exe,它的嵌套展开能力更可靠
VS Code 扩展适合快速验证小文件结构和简单过滤,但别指望它替代桌面版或浏览器版的查询深度。最易被忽略的是:它不缓存元数据,每次打开都重新读 Schema,所以反复切换文件时延迟明显。如果日常处理 GB 级嵌套 Parquet,优先用本地桌面版,VS Code 插件只当临时查看器用。











