第 115 期 · AI 数据分析工具
微软把「数据分析」变成聊天——但先别急着装
Data Formulator:用自然语言把 CSV、数据库变成可视化报告
一句话判断:如果你还在 Excel 和聊天框之间来回切、把表格贴给 AI 求一张图,Data Formulator 值得试;但它现在还是 0.8 beta,而且大模型密钥得你自己准备。
做数据分析难,往往卡在两件事:数据散在文件、数据库、数据仓库各处,接起来费劲;问题又总是越问越多,聊着聊着就忘了自己从哪条路走过来的。Data Formulator 就是微软研究院为这件事做的工具——把界面操作和自然语言合在一起,让分析师既能说清楚意图,又能随时分叉出不同的分析路径。
它到底是做什么的
Data Formulator 是一个由 AI 智能体驱动的数据探索与可视化工具。它的核心不是「再做一个图表库」,而是给分析流程安了两样东西:
- ●数据连接器:用统一的方式接入文件、本地文件夹、数据库、Databricks 等平台,并维护一份「数据记忆」,记住不同数据源之间的关系。
- ●数据线程(Data Thread):你可以在一条线索里不断追问、把任意一步分叉成另一条路、用可视化对比不同结论,而不会丢掉前面的上下文。
图表本身由微软开源的 Flint 语言生成,支持 30 多种图表类型,还能做主题和样式微调。
怎么用
项目同时提供桌面版、uv/pip 安装、Docker 三种方式,命令均来自官方 README:
uvx data_formulator
pip install data_formulator python -m data_formulator
docker compose up --build
启动后默认在浏览器 http://localhost:5567 打开。用法很直接:先把你手上的数据丢进去——CSV、TSV、Excel、JSON、截图甚至一段文字都行;也可以让它自己去找并加载数据。之后在 Data Thread 里用自然语言提问,跟着推理过程看表格和可编辑图表,从任意一步分叉,或者把结果整理成一份可分享的报告。
优点
- ●真开源、真免费:MIT 协议,本地就能跑,不绑云账号。
- ●多数据源:文件、本地文件夹、数据库、Databricks 都能接,内置 DuckDB 支撑较大数据。
- ●思路可追溯:Data Thread 让「我是怎么分析到这的」一目了然,分叉对比不丢上下文。
- ●图表能力强:Flint 30+ 图表类型,带推荐和样式微调。
- ●模型灵活:通过 LiteLLM 支持 OpenAI、Azure、Ollama、Anthropic,有显卡就能走本地模型。
缺点
- ●仍是 beta:当前 0.8.0b1 是预览版,桌面构建未做代码签名和公证,Windows 会弹 SmartScreen、macOS 会报「无法验证」,需要手动放行。
- ●要自备模型密钥:云端模型得自己填 API key;走本地 Ollama 也得先有模型和算力。
- ●研究院原型定位:它不是面向企业的成品,权限治理、团队协作这些没在重点讲。
- ●贡献门槛:提交代码要签微软的 CLA(贡献者协议)。
最终效果:适合谁,不适合谁
适合:常和 CSV、库表打交道、想快速探索并出图的数据分析师;已经有 LLM key 或本地 Ollama 的个人/小团队;想把分析过程留下痕迹、方便复盘的人。
不适合:想要「双击就能用、一个 key 都不填」的纯小白;对权限、审计、多人协作有硬要求的企业场景;没有任何模型算力又不愿接云服务的离线用户。
三个坑:第一,beta 桌面版没公证,系统会拦,要从本仓库的构建产物或 Release 下载才放心;第二,云端模型按量计费,大表反复探索成本要算清;第三,它解决的是「探索和分析」,不是「清洗管线」——脏数据还得你自己先理。
下期预告
回到「本地优先」主线,做一期代码检索三件套横向对比——ck(语义 grep)/ 自托管向量库+代码分块 / 传统 ripgrep 管线,讲清各自边界与选型。
本文基于 microsoft/data-formulator 官方仓库 README 与许可证信息整理;安装命令逐字取自 README。项目采用 MIT 协议。抓取时间 2026-09-15。
