V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  slowgen  ›  全部回复第 5 页 / 共 29 页
回复总数  568
1  2  3  4  5  6  7  8  9  10 ... 29  
2025 年 5 月 17 日
回复了 yyluxe 创建的主题 macOS 请教 Mac studio 部署 ai,用 ollama 还是 lm studio
用 LM Studio ,配合 MLX 和 DWQ 量化(最新的一个量化方法,质量很好)很不错,开 KV Cache 也方便,我拿 M2 Ultra 跑 Qwen3-30B-A3B-DWQ 的 4bit 版可以到 105token/s ,Qwen3-235B-A22B-DWQ 的 4bit 版本也能到 32token/s
2025 年 5 月 14 日
回复了 cj323 创建的主题 Node.js 吐槽一下 bun
bun 确实不稳定,有一些号称兼容了 node 的 api 其实还没兼容,加密库和文件流这块目前还有问题,我测试 exceljs 经常生成不了文件,http 库也有一个和 deno 一样的问题就是不支持 connect 事件,不知道是不是本身单元测试就有问题。

内存占用也有问题,同样的代码在 windows 下占用一百多 MB 内存,去到 linux 只占用 7MB…倒是 bun 内置那些函数库非常实用。其实碰到兼容性的问题如果能拆成独立小 api 用 node 或者 deno 去部署的话倒也还能接受,我就拆了 2 个这样的 api 。

deno 就很稳,拿来替代 node 一点问题都没有。

node 从 15 到现在的 24 都没啥吸引人的新特性,绝大部分都是缝缝补补,被 deno 和 bun 追上那是一点都不冤枉。
hk 节点拖了几个 T 的对象存储数据回来,没感到限速
2025 年 5 月 4 日
回复了 ysicing 创建的主题 美酒与美食 最近再喝冷泡茶, 有没有好的推荐?
绿茶系都可以,我一般是用狮峰的龙井或者茉莉,比例是 8 克茶叶一升水,如果泡 2 天以上可以减少 1 到 2 克茶叶,只要容器干净可以在冰箱放 2 周。
2025 年 3 月 16 日
回复了 Unclev21x 创建的主题 Apple 苹果刚刚推出了新款 Mac Studio
@mewking pcie 通道速度不会降低多少性能,现阶段 ExoLabs 的方案是靠网络通信都能玩,推理模型交换数据挺少的,刚好新鲜出炉一个部署案例 https://www.bilibili.com/video/BV1FvQrYQEPc
2025 年 3 月 7 日
回复了 Unclev21x 创建的主题 Apple 苹果刚刚推出了新款 Mac Studio
@mkdirmushroom
@jqknono
我的 Mac Studio 就是 192GB 的 M2 Ultra ,对于 M3 Ultra 跑 deepseek V3/R1 的速度我意见和 33 楼一致,最多是随着上下文越大速度不断衰减
2025 年 3 月 7 日
回复了 Unclev21x 创建的主题 Apple 苹果刚刚推出了新款 Mac Studio
@dongfanga 但是两者的激活参数差不多,速度上差距不大,得具体实测所有题目才好说,我只测了代码能力。而且 qwq-32b 跑起来条件太简单了,搞两张 16-24g 显存的卡,2 张 a770 都可以没什么压力
2025 年 3 月 7 日
回复了 Unclev21x 创建的主题 Apple 苹果刚刚推出了新款 Mac Studio
@dongfanga 可行啊,我玩了一天了,6bit 量化下回答质量和 grok3 差不多
2025 年 3 月 5 日
回复了 Unclev21x 创建的主题 Apple 苹果刚刚推出了新款 Mac Studio
32B 模型 4bit 量化在 M2 Ultra 可以跑到 42token/s (开启 KV Cache ),而 deepseek v3 和 r1 的激活参数量都是 37B ,总参数量 671B ,在 512GB 内存上跑 4bit 量化为主,大体上也是 40~45token/s 左右(对比 M2 Ultra 算力和带宽的提升和激活参数变化所得)。
对比 deepseek 现在的官网价格,v3 每百万 token 输出为 8 元,r1 是 16 元,用 Mac Studio M3 Ultra 512GB 拿来跑 deepseek v3 的话大概是 74249/8 * 1000000 / 45 / 86400 = 2387 天回本,跑 r1 回本速度快一倍,只需 1193 天。
2025 年 3 月 4 日
回复了 momowei 创建的主题 计算机 帮忙看看这个 diy 装机配置搞开发怎样
@ifwww 我装过 3 个开发机了,一开始都是想着扩展性,到最后最多也就插个显卡插个机械盘。不如小型化,平时也方便带去公司做个团队测试环境,淘汰了还方便寄给家人。
2025 年 3 月 4 日
回复了 momowei 创建的主题 计算机 帮忙看看这个 diy 装机配置搞开发怎样
搞个 7945HX 准系统就行了 比如 https://item.jd.com/10122934326058.html ,两千多,16 核 32 线程,功耗低性能强,搞成迷你主机方案还不占地方,再插 2 条 48g 内存,妥妥的小钢炮。
2025 年 2 月 20 日
回复了 oldManNewThought 创建的主题 程序员 求大佬指点, ai 加知识库的内部原理
就是找出相关内容然后字符串拼接,看 llamaindex 代码就懂了,知识库都是围绕那三五十行代码做各种业务和 UI 的封装。
https://github.com/run-llama/llama_index/blob/81d4b871143ddd4a7cb90333a3d103fbb1f269c5/llama-index-core/llama_index/core/prompts/chat_prompts.py#L21

消耗 token 那是肯定的,所以去年 5 月 deepseek 把价格打到几乎是全行业的 1%,搞得其它几家也跟着降价,不然现在哪有那么多知识库的需求。
2025 年 2 月 15 日
回复了 lucien94xxx 创建的主题 Local LLM Deepseek R1 671B 本地部署计算机硬件配置?
什么并发要求?
https://x.com/carrigmat/status/1884244369907278106 6000 美元,用双路 epyc + 24 通道 ddr5 跑 q8 规格,6~8 token/s ,实际功耗不到 400w ,当然随着上下文越大每秒 token 数会下降,而且不出意外并发只有 1 。

然后最近又出了一个更多快好省的方案 KTransformers
https://github.com/kvcache-ai/ktransformers/blob/main/doc/en/DeepseekR1_V3_tutorial.md
https://www.reddit.com/r/LocalLLaMA/comments/1ilzcwm/671b_deepseekr1v3q4_on_a_single_machine_2_xeon/

将闲置的专家从内存中卸载、将核心专家放入显存而边缘专家放入内存,和 23 年年底上海交大那个 PowerInfer 思路很像,充分利用 CPU 和 GPU 的资源,按照上面的 cpu 方案加几块卡就够了。


需求不急的话可以等一波,先用着各种供应商提供的 api ( together.aifireworks.ai 等)
2025 年 2 月 15 日
回复了 raw0xff 创建的主题 Local LLM 想让本地运行的大语言模型可联网该怎么做?
https://docs.openwebui.com/features/ 这个集成了搜索,源码里集成了好几家搜索引擎,免费的话用的是 duckduckgo 的 https://github.com/open-webui/open-webui/blob/2017856791b666fac5f1c2f80a3bc7916439438b/backend/open_webui/retrieval/web/duckduckgo.py#L12 ,在容器里配个 http_proxy/https_proxy 或者丢海外部署就好了。
2025 年 2 月 3 日
回复了 importmeta 创建的主题 Node.js 吐槽一下 Nest.js 太复杂了
Nestjs 封装是有点过度了,既然是 TypeScript 这种语言加上 Node 的 runtime ,很多东西是可以做减法的。
我用的时候就做了很多减法,比如:
service 全部用 static 函数,就不需要注入了,要 mock 直接 class.method = function(){},要是非 static 的就 class.prototype.method 重新赋值来覆盖;
Providers 直接不用,官方案例简直是神经病连 HttpClient 都封装一层,它以为自己在用.NET 上吗,还不如开个文件在里面定义个常量然后导出,不也是全局唯一的吗;
Guards 也放弃,哪来那么多策略,直接在 Middleware 里简单鉴权就行了,复杂的我宁愿单独写一个 api 网关;
Modules 只拿来做业务模块区分,里面只引入控制器;

现在,我直接换 hono 了,搞个 module 文件夹自己分层就好了
2025 年 2 月 3 日
回复了 leenhawk2 创建的主题 程序员 安卓 16 支持 Linux 子系统了
连 Linux 子系统都支持了,按这个发展说不定再迭代几个版本就把 Chrome OS 给合并完了,然后放弃 Chrome OS
2025 年 2 月 1 日
回复了 scienhub 创建的主题 程序员 腾讯云的 nodejs sdk 安装后 85M
@datou 看走眼了,还以为只用了腾讯云的 cos 。要是用 deno 的话在代码目录就可以没有 node_modules 了,眼不见为净。

to 楼主,node 项目我以前用 pkg 打成二进制放容器里的,整个 Docker 镜像压缩后只有 60~70MB 左右,还挺好用
2025 年 2 月 1 日
回复了 scienhub 创建的主题 程序员 腾讯云的 nodejs sdk 安装后 85M
已经不用 Node 了,现在小项目在选 Deno 和 Bun 。Bun 在 1.2 内置了 S3 和 Postgres 客户端,可以给项目做不少减法 https://bun.sh/blog/bun-v1.2
1  2  3  4  5  6  7  8  9  10 ... 29  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2720 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 27ms · UTC 11:23 · PVG 19:23 · LAX 04:23 · JFK 07:23
♥ Do have faith in what you're doing.