用于 AI 驱动您真实 Chrome 会话的桥接工具
chrome-bridge,来自Siropkin,是一个MCP服务器加Chrome扩展,旨在为AI代理提供对用户活动Chrome会话的受控访问,以进行基于浏览器的任务。它通过本地WebSocket暴露标签列表、完整页面HTML/文本检索、屏幕截图和点击输入自动化,使AI驱动的本地化和页面内工作流成为可能。该工具针对需要经过身份验证的真实会话访问的开发人员和高级用户,同时保持所有处理本地和无遥测。
你实际上可以用它做什么任务?
该工具旨在进行以浏览器为中心的自动化和分析,特别是ai-text-localization和类似的工作流程。它可以列出打开的标签页并返回活动标签页的URL或标题,检索完整页面文本或HTML以进行分析,捕获高保真截图,并执行点击和输入操作,以便代理可以与表单字段交互或浏览页面。用例包括本地化文案提取、凭证页面检查和视觉验证。
页面捕获和自动化操作的可靠性如何?
chrome-bridge生成与实时浏览器相关的输出,这保留了登录状态和扩展;这一基本事实意味着HTML检索和截图反映了用户所看到的真实页面。该扩展的截图和完整页面检索支持视觉和文本AI分析,浏览器驱动的点击/输入在真实DOM上操作。然而,复杂单页应用程序上的动态客户端行为可能仍然需要人工审查自动化操作。
它接受什么输入,限制是什么?
该工具接受活动的Chrome会话作为输入表面,并向代理提供页面HTML、文本和图像。它需要Google Chrome v117+和Node.js v18+,并且期望能够使用模型上下文协议的客户端,因此兼容性取决于一个支持MCP的代理。它不是一个无头替代品,也不创建隔离的浏览器实例,这限制了在需要隔离环境的用例中的使用。
设置是否易于接近,隐私如何处理?
设置使用零依赖的Node CLI和一个通过本地WebSocket绑定的Chrome扩展,这使得所有处理都在本地机器上进行。该扩展显示一个药丸覆盖,叙述代理命令,提供关于操作的可见反馈。开发者表示没有遥测,执行是本地的,因此隐私控制和可见叙述帮助用户监控和限制代理可以做的事情。
适合需要直接、经过身份验证的浏览器访问的开发者
chrome-bridge 是一个实用的选项,适合需要与现有的经过身份验证的浏览器会话进行 AI 驱动交互的开发者和高级用户,并且优先考虑本地处理。它要求支持 MCP 的客户端和当前的 Chrome 和 Node 运行时,并且在与动态或敏感页面交互时,自动化结果应手动验证。将其作为开发工具来增强,而不是替代,网络工作流程中的人工验证。