WhatCanJevDo
返回
browseragents开源

Jev Voice Browser

用户还没说完,浏览器就开始理解并准备执行语音命令。

Jev 决定什么

用户想做什么、作用于哪个页面目标、命令是否完整,以及动作是否具有破坏性。

每段 partial transcript 都会交给 Jev:它判断意图并从当前页面选择目标,同时分别判断命令是否完整、能否执行以及是否具有破坏性。

CHOICENOULSCORE
Jev 的职责
把未说完的语音解析成受限的浏览器意图、目标和安全判断。
输入
partial transcript、当前 URL、标签页、可见交互元素和近期浏览器状态。
输出
意图与目标的 Choice 分布、命令状态与风险的 Noul 概率,以及滚动距离 Score。
决策频率
每收到一段 partial transcript 调用一次。
兜底方式
等待更多语音或请求确认;最终选择的操作由确定性的 Playwright 代码执行。
作者自报 · 已核对来源

运行方式

输入
partial transcript、当前 URL、标签页、可见交互元素和近期浏览器状态。
Jev
CHOICE + NOUL + SCORE
输出
意图与目标的 Choice 分布、命令状态与风险的 Noul 概率,以及滚动距离 Score。

公开性能数据

Reported Jev latency

250–350 ms

Resolve one partial voice transcript against the current page.

作者自报 · 已核对来源

采集于 2026年9月21日

Reported cost per request

0.0002 USD

One partial-transcript decision request.

作者自报 · 已核对来源

采集于 2026年9月21日

项目概览

Jev Voice Browser 通过 Playwright 控制带界面的 Chromium。它把当前页面中可见、可交互的元素整理成精简状态,并把每段语音转写交给 Jev,因此安全动作可以在最终转写到达前开始准备或执行。

意图、站点、元素和标签页使用受限 Choice;完整性、命令有效性和破坏性风险使用 Noul;滚动距离使用 Score。破坏性动作需要用户确认。原型在 localhost 上运行且没有认证,不适合直接暴露为公开服务。

开发语言
JavaScript
许可证
MIT
作者
Moritz Kremb
来源核对于 2026年9月21日

信息来源

相关项目