让 ai 监控画面,然后自动执行处理,7*24 运行,哪家比较合适?另外不能太慢,那 chatgpt5.6 sol 跑了一天,效果挺不错的,但是太慢了,一次请求要 10s 左右,延长太高经常出问题。
以前在 v 站看到一个模型对比表格,列出了各个模型的参数量、价格、跑分,但是现在搜不出来了,哪个大哥能再给一个吗
以前在 v 站看到一个模型对比表格,列出了各个模型的参数量、价格、跑分,但是现在搜不出来了,哪个大哥能再给一个吗
1
clemente 6h 32m ago
哥们 NASA 都不敢这么用
|
2
AutumnVerse OP |
3
ruanimal 4h 13m ago
一天几千块而已。。
|
4
clemente 4h 12m ago
@AutumnVerse 首先多模态的模型不是干监控的。99%的多模态就是 画面描述器的胶水模型 和 LLM 投影沾到一起的
我不知道你实际的工作需求,如果能走 cli 还是尽可能走 cli 或者 headless |
5
wizChen 3h 2m ago
这种本地部署比较好吧
|
6
Nasdaq 3h 0m ago
这,OP 拿一张监控画面跑一下看看成本,要是 24 小时非常夸张的。。。
|
7
AutumnVerse OP |
8
AutumnVerse OP @clemente 现在是写了一个程序,把相关画面抽帧给 ai ,让 ai 发现某些事件,调用对应的 function 处理。
主要问题是 sol 太慢了,导致抽帧非常少,两帧中间的内容就丢掉了。尝试了 gemini flash 3.8 ,看统计也要 4s 左右一次,也没快多少。 |
9
Nasdaq 2h 46m ago
@AutumnVerse #7 这是我一个类似项目用 gemini-3.7-flash 做图片理解(仅供参考),图片分辨率大概 1080p 左右
Routing 197ms Google 2.6s Generation 8.5s Total 11.3s Cost $0.00632 Throughput 179.0tok/s |
10
xujinkai 2h 41m ago via Android
并发呗,真有钱🤣
|
11
AutumnVerse OP @Nasdaq 那跟我测试差不多,我用的 480p 会快一点。但是总耗时也要 4s 左右。
|
12
tim9527 2h 39m ago
想想就好贵,家底富裕啊
|
13
clemente 2h 38m ago
@AutumnVerse 我 6 年前做过类似的,我做的是检测+跟踪。我的方法是帧不变走缓存,帧变了走识别那一套逻辑,但是有一点因为设备计算能力达不到实时,所以我加了异步队列和跳帧方法,这样能保证所有事件捕捉+某个场景能同步到实时
|
14
cvooc 2h 37m ago
误闯天家系列, 没这么用过...
|
15
wysnxzm 2h 34m ago
做异步,延迟 10s 而已不会漏数据
|
16
winterx 2h 30m ago
你需要的是视频算法而不是 AI ,当然 AI 也能干这事就是太烧钱了
如果成本受限可以考虑海康、商汤或者旷视 |
17
AutumnVerse OP |
18
la9998372 2h 20m ago
你是啥场景啊?非要用大模型来做?
现在的 qwen3.8flash 和 glm5.3flash 都支持多模态了,应该性价比和性能都挺不错吧 |
19
cvooc 2h 19m ago
@AutumnVerse #17 哪怕让 ai 写算法呢...花点钱...上肥波,上 astra... 也比直接让 ai 识别强啊...
|
20
gpt5 2h 15m ago
我知道几家公司的主营业务就是这个。
上百个监控全接进来,实时 ai 分析。 |
21
AutumnVerse OP @gpt5 直接上大模型还是传统的 yolo 类的小模型?
|
22
gpt5 1h 17m ago
@AutumnVerse 本地大模型+精巧的系统设计+极限优化
|