首页
课程
问答
CTF
社区
招聘
峰会
发现
排行榜
知识库
工具下载
看雪20年
看雪商城
证书查询
登录
注册
首页
社区
课程
招聘
发现
问答
CTF
排行榜
知识库
工具下载
峰会
看雪商城
证书查询
社区
AI 助力安全
发新帖
0
12
[原创] 安全和开发场景下大模型使用经验随笔
发表于: 4天前
106
[原创] 安全和开发场景下大模型使用经验随笔
不歪
3
4天前
106
## 引言 过去一段时间,我在软件开发和 CTF 上烧掉了上百亿 Token。用量上来之后,一些反复出现的现象逐渐清晰。这篇文章记录我在开发和安全两个场景下的观察,先给结论:大模型没有逻辑思维,它只是在做 Token 接龙——根据已有文本,把下一个最可能的 Token 输出出来;但在人的经验和管控之下,它能极大地提升效率,是我的重要助手。 ## 一、安全场景:暴力探索容易钻进死胡同 对于安全分析,D 开头的模型(下文简称 D 模型)和 G 开头的模型(下文简称 G 模型)都可以用,因为安全分析不需要设计良好的开发架构,需要的是经验、知识、不断探索、根据反馈继续做下一步方案的选型,而这些正是大模型的强项。 从直觉上看,安全分析不需要架构设计、不需要逻辑复用,只需要不断的暴力探索,似乎正好适合大模型。但用多了之后就知道,大模型并不是银弹,它最突出的问题是钻牛角尖之后出不来,进而在一个方向上分析很久都无法攻破。 举个 CTF 的例子:模型自己扒出了一个隐藏账号,而题目信息说这个账号是 admin 权限,它就深信不疑、从不怀疑。即使反复用这个账号去取 flag 都失败了,它依然相信这是真的 admin 账号。换作人类,正常的逻辑应该是:试了这么久都不行,我是不是该怀疑题目里那句描述是假的、是烟雾弹? > D模型 或 G模型 在安全场景我认为无区别。 > 中途更换模型我认为无影响,给安全分析任务中途更改模型就当是换换脑子了,实测换脑子无问题。 ## 二、开发场景:架构与一致性是短板 开发场景的问题则不一样。抛开业务逻辑不谈,大模型在架构设计、逻辑抽象、实现合理性这几个方面的问题比较大。举个例子(抛开业务背景、纯看中性代码):一个参数是否应该有默认值,它没有稳定的判断,有时写成有默认值,有时写成无默认值;两处数据结构完全一样的情况下,它意识不到其中某些数据其实是同一类数据,这不需要任何业务背景,纯分析逻辑就能得出结论,但它做不到。 所以,如果你做的软件是商用的,人工 Review 必不可少。 ## 三、根因:它没有逻辑思维 上面两类问题,我认为根源是同一个:大模型没有逻辑思维。它的本质是 Token 接龙,只负责把下一个 Token 输出出来,并不维护一个可以被证据推翻的假设。 对于安全场景,用自己设计的反思机制能缓解,或者用人的逻辑思维和经验去补充;对于开发场景,只能用自己的逻辑思维和经验去补齐它的短板。 > 可以看我的这篇文章:<a href="elink@361K9s2c8@1M7s2y4Q4x3@1q4Q4x3V1k6Q4x3V1k6E0M7q4)9J5k6i4N6W2K9i4S2A6L8W2)9J5k6i4q4I4i4K6u0W2j5$3!0E0i4K6u0r3M7#2)9J5c8V1I4w2c8Y4k6m8g2f1g2w2x3V1H3$3g2s2k6f1h3s2k6$3K9e0m8h3N6@1p5`.">第 07 章 · 幻觉与遗忘</a>:<mark class="encrypted">d36K9s2c8@1M7s2y4Q4x3@1q4Q4x3V1k6Q4x3V1k6E0M7q4)9J5k6i4N6W2K9i4S2A6L8W2)9J5k6i4q4I4i4K6u0W2j5$3!0E0i4K6u0r3M7#2)9J5c8V1I4w2c8Y4k6m8g2f1g2w2x3V1H3$3g2s2k6f1h3s2k6$3K9e0m8h3N6@1p5`.</mark> > 完整合集:<a href="elink@78bK9s2c8@1M7s2y4Q4x3@1q4Q4x3V1k6Q4x3V1k6E0M7q4)9J5k6i4N6W2K9i4S2A6L8W2)9J5k6i4q4I4i4K6u0W2j5$3!0E0i4K6u0r3L8i4m8Q4x3V1k6S2M7s2m8E0M7$3N6S2L8r3u0#2L8g2)9K6c8W2)9#2k6W2)9#2k6X3u0A6P5W2)9K6c8p5#2*7d9i4N6a6g2q4g2%4e0@1c8C8x3f1#2%4i4K6y4p5i4K6y4p5i4K6t1$3j5h3y4@1K9h3!0F1i4K6y4p5k6$3g2@1j5h3I4T1N6h3#2Q4x3U0k6S2L8r3u0#2L8g2)9#2k6X3W2V1i4K6y4p5y4o6j5@1x3U0t1H3y4o6f1K6x3o6M7$3y4U0j5J5y4U0R3I4y4#2)9J5x3%4N6W2j5$3S2S2N6q4)9#2k6Y4u0W2k6r3W2J5k6h3y4@1">大语言模型(LLM)学习</a>:<mark class="encrypted">359K9s2c8@1M7s2y4Q4x3@1q4Q4x3V1k6Q4x3V1k6E0M7q4)9J5k6i4N6W2K9i4S2A6L8W2)9J5k6i4q4I4i4K6u0W2j5$3!0E0i4K6u0r3L8i4m8Q4x3V1k6S2M7s2m8E0M7$3N6S2L8r3u0#2L8g2)9K6c8W2)9#2k6W2)9#2k6X3u0A6P5W2)9K6c8p5#2*7d9i4N6a6g2q4g2%4e0@1c8C8x3f1#2%4i4K6y4p5i4K6y4p5i4K6t1$3j5h3y4@1K9h3!0F1i4K6y4p5k6$3g2@1j5h3I4T1N6h3#2Q4x3U0k6S2L8r3u0#2L8g2)9#2k6X3W2V1i4K6y4p5y4o6j5@1x3U0t1H3y4o6f1K6x3o6M7$3y4U0j5J5y4U0R3I4y4#2)9J5x3%4N6W2j5$3S2S2N6q4)9#2k6Y4u0W2k6r3W2J5k6h3y4@1</mark> ## 四、我对大模型评价的三个阶段 我对大模型的评价经历了三个阶段: 1. 阶段一:真牛逼。 2. 阶段二:傻子。 3. 阶段三:它是我的重要助手。 很多人可能觉得奇怪:"我用大模型觉得很牛逼啊,为什么你会觉得它是傻子、没有逻辑思维?"答案就在上面的例子里:它输出的每一步看起来都流畅、专业,但当需要根据反馈推翻自己先前的判断时——怀疑账号描述是烟雾弹、判断两处数据是一类——它做不到。此类例子不胜枚举。 "傻子"说的是它没有逻辑思维;"重要助手"说的是在我自己的经验和管控之下,它能极大地提升我的效率。这两个评价并不矛盾,合并起来才是完整定位:它蠢的很高效,我用它产出的可用部分,不可用的部分再改。 > 一些 AI 新闻:我看 AI 新闻,一会儿说 AI 自己建设论坛互相沟通,一会儿讨论 AI 是否有意识。我的判断是**当前的AI**没有逻辑思维,它是 Token 接龙器。所以我看此类新闻总会冒出疑惑:是“演”的么? ## 五、消耗大量 Token 等于大量经验 一件事情从入门到熟练再到经验丰富,需要消耗大量资源,用大模型也不例外。我对大模型的这些判断、经验,是 Token 烧出来的: - 没烧多少的时候觉得"真牛逼"。 - 烧到一定量发现它是"傻子"。 - 烧够了之后,自我妥协把它定位成"重要助手"。 > 在 AGI 没有到来之前,AI 的短板需要用 SKILL、COMMAND、MCP、PLUGIN 这些自定义扩展机制去补齐、缓解。 ## 六、不要自己部署主力模型 详见 [Qwen3.8 本地部署:并非优选方案,看完再决定](https://bbs.kanxue.com/thread-293123.htm)。 ## 结语 - 在开发场景:大模型在架构设计、逻辑抽象、实现合理性上不可靠,商用软件必须有人 Review。 - 在安全场景:它擅长暴力探索,但容易钻牛角尖出不来。根源在于它没有逻辑思维,只是 Token 接龙。 因此,要靠 AI 工具的自定义扩展机制去补齐、缓解。
回复或点赞可查看完整内容
传递专业知识、拓宽行业人脉——看雪讲师团队等你加入!!
最后于
3天前 被不歪编辑 ,原因:
收藏
・
0
点赞
・
12
打赏
分享
分享到微信
分享到QQ
分享到微博
赞赏记录
参与人
雪币
留言
时间
mb_qywrlikf
这个讨论对我很有帮助,谢谢!
13小时前
Jing_X
感谢你的贡献,论坛因你而更加精彩!
14小时前
keepingrun
你的帖子非常有用,感谢分享!
15小时前
git_53731Amoswish
感谢你分享这么好的资源!
15小时前
git_51951meggadf3df
非常支持你的观点!
19小时前
qqizai
期待更多优质内容的分享,论坛有你更精彩!
22小时前
风兮木晓
期待更多优质内容的分享,论坛有你更精彩!
1天前
ngiokweng
为你点赞!
1天前
cr_lgdx
感谢你分享这么好的资源!
2天前
lookaside
谢谢你的细致分析,受益匪浅!
2天前
mb_qtvylfog
你的帖子非常有用,感谢分享!
2天前
mb_wspiyiep
为你点赞!
3天前
查看更多
赞赏
×
1 雪花
5 雪花
10 雪花
20 雪花
50 雪花
80 雪花
100 雪花
150 雪花
200 雪花
支付方式:
微信支付
赞赏留言:
快捷留言
感谢分享~
精品文章~
原创内容~
精彩转帖~
助人为乐~
感谢分享~
最新回复
(
5
)
Imxz
雪 币:
110
活跃值:
(9571)
能力值:
( LV2,RANK:10 )
在线值:
发帖
6
回帖
775
粉丝
9
关注
私信
Imxz
2
楼
tql
3天前
0
mb_xjdhrmck
雪 币:
78
能力值:
( LV1,RANK:0 )
在线值:
发帖
0
回帖
154
粉丝
0
关注
私信
mb_xjdhrmck
3
楼
666
2天前
0
xianhuimin
雪 币:
9341
活跃值:
(6228)
能力值:
( LV2,RANK:10 )
在线值:
发帖
5
回帖
231
粉丝
2
关注
私信
xianhuimin
4
楼
看看
2天前
0
ylp1332
雪 币:
95
活跃值:
(4051)
能力值:
( LV12,RANK:610 )
在线值:
发帖
41
回帖
226
粉丝
4
关注
私信
ylp1332
15
5
楼
666
2天前
0
mb_ndzyrrkt
雪 币:
20
能力值:
( LV1,RANK:0 )
在线值:
发帖
0
回帖
8
粉丝
0
关注
私信
mb_ndzyrrkt
6
楼
6666
22小时前
0
游客
登录
|
注册
方可回帖
回帖
表情
雪币赚取及消费
高级回复
返回
不歪
3
45
发帖
70
回帖
150
RANK
关注
私信
他的文章
[原创] 安全和开发场景下大模型使用经验随笔
103
[原创] Qwen3.8 本地部署:并非优选方案,看完再决定
365
[原创] OpenSecurity 2.0 无人值守完成 CTF 所有 Web 挑战
203
[原创][开源]OpenSecurity:AI 驱动的多领域安全自动分析 Agent 平台
7035
[原创][AI分析Web漏洞] 掰开揉碎讲解 CyberGame 难度Hard 477 分 — Web Cache Poisoning 完整 Writeup
10582
关于我们
联系我们
企业服务
看雪公众号
专注于PC、移动、智能设备安全研究及逆向工程的开发者社区
看原图
赞赏
×
雪币:
+
留言:
快捷留言
为你点赞!
返回
顶部