penzi
V2EX  ›  OpenAI

超过 500 行的代码改动, codex 根本无法独立完成。astra 也不行

  •  2
     
  •   penzi · 2h 25m ago · 3717 views

    自回归模型不回归

    怪不得 OpenAI 要推迟上市

    Supplement 1  ·  1h 51m ago




    希望评论的人都可以一直不用 claude ,否则失去的感觉太难受了
    Supplement 2  ·  1h 21m ago
    请大家 block 我,夏虫不可语冰
    59 replies  •  2026-10-10 11:49:57 +08:00
    CodingIran
        1
    CodingIran  
       2h 14m ago
    什么玩意,公司几十万行代码的项目一直都是用 Codex 开发的,从来没遇到这种问题
    penzi
        2
    penzi  
    OP
       2h 13m ago   ❤️ 3
    @CodingIran 那你们的项目真挺简单的
    nullyouraise
        3
    nullyouraise  
       2h 11m ago
    我改 Chromium 都是 Astra 一把梭,从来没遇到过问题,难以想象你们的项目是有多复杂
    lozzow
        4
    lozzow  
       2h 10m ago
    @nullyouraise 甚至我用的 DeepSeek 4.1 flash 也能改得动
    Finest
        5
    Finest  
       2h 6m ago
    昨天才让 6.1-sol 一次改了 2000 多行代码,真不知道你的项目有多复杂
    MHPSY
        6
    MHPSY  
       2h 6m ago
    我自己弄了个指纹浏览器 用 claude 5.5 打 patch 改的很好
    changnet
        7
    changnet  
       2h 5m ago
    AI 基本只能在已有功能的例子上添加功能。如果没有框架限制,没有例子,尤其是需要扩展、修改原有框架实现时,现有的 AI 确实就是不行,跟代码行数没有太大关系

    或者说 AI 实现得很奇怪,各种 if-else 打补丁。有些明明在基类扩展一个虚函数就很优雅,它偏不。除非不关注代码质量和后续维护,否则很难不人工修改
    xing7673
        8
    xing7673  
       2h 4m ago
    降智了吧,现在黑 codex 都已经泥沙俱下了么?
    cat9life
        9
    cat9life  
       2h 2m ago
    画个鹈鹕看看,大概率是降智了。
    DOOMS
        10
    DOOMS  
       2h 2m ago
    不知道的以为是去年发的帖子。
    penzi
        11
    penzi  
    OP
       2h 1m ago


    随便找个三分钟前的例子,一次判断都做不好的模型,长任务的结果会是怎样?
    Y25tIGxpdmlk
        12
    Y25tIGxpdmlk  
       2h 0m ago   ❤️ 3
    求大神让我们见识一下超高质量的项目代码(不简单的项目),学习一下。
    maxwellz
        13
    maxwellz  
       1h 59m ago
    可能被降智到 luna 了
    penzi
        14
    penzi  
    OP
       1h 57m ago
    @maxwellz 随机数测试测过了,就是 astra 。
    CodingIran
        15
    CodingIran  
       1h 56m ago   ❤️ 1
    @penzi 不会接了个垃圾中转站,然后被降智后把责任怪到 codex 上了吧
    Dk2014
        16
    Dk2014  
       1h 53m ago via Android
    这个页面怎么跟 codex 不一样😅
    o/前段时间本来就在治中转,并发多了就降智
    你不会开了转发来用的吧
    zeroFans
        17
    zeroFans  
       1h 50m ago
    至少用上官方的 codex 再说话吧
    haoooooooo
        18
    haoooooooo  
       1h 49m ago
    哥们,你是认真的吗?确定不是用的什么山寨 Codex ?
    虽说 Astra 比不上 Opus5.5 ,但是也没不堪到这种地步。。。
    alamaya
        19
    alamaya  
       1h 46m ago
    codex 需要有一个比较好的编码规范给到他才行
    supersleepking
        20
    supersleepking  
       1h 46m ago
    华为用户啊不奇怪了,大家喷之前可以看下这人发帖记录很有意思
    icelas259
        21
    icelas259  
       1h 45m ago
    你这是掺水模型吧。先去订阅官方的 codex 看看。
    mwenhua2023
        22
    mwenhua2023  
       1h 44m ago
    5w 行都改得动
    location123
        23
    location123  
       1h 44m ago
    deepseek 改个 500 行也是绰绰有余的吧
    BanShe
        24
    BanShe  
       1h 43m ago
    xs😂
    StarsunYzL
        25
    StarsunYzL  
       1h 42m ago   ❤️ 9
    送人头 block ,但凡对当前的 AI 能力有一丁点认知+有一丁点思考能力的都会反思和反复验证自己哪里出问题了而不是下这种不过脑子的结论
    strobber16
        26
    strobber16  
       1h 38m ago
    微内核
    sima675
        27
    sima675  
       1h 37m ago
    一个用中转站的就不要评论了,自己被卖了也不知道
    xylxAdai
        28
    xylxAdai  
       1h 32m ago
    你用的什么垃圾中转站啊。500 行都改不动。你用半年前的 glm 都不至于五百行改不了。更别提 codex 了。
    pengtx
        29
    pengtx  
       1h 29m ago
    懒得喷
    hookbreak
        30
    hookbreak  
       1h 28m ago
    你用的中转站吗
    furlxy
        31
    furlxy  
       1h 26m ago
    你这个智能机器人是个什么?
    中转被偷换了模型,自己不知道么?
    osilinka
        32
    osilinka  
       1h 23m ago
    ms build, 肯定是微软的系统,如果没有足够的 training 材料,肯定是这样啊

    现在都把 AI 看的太聪明了
    Satoshl
        33
    Satoshl  
       1h 23m ago
    截图中转站绷不住了,自己还能发出来
    Haku
        34
    Haku  
       1h 22m ago
    @penzi #14 随机数测试只能在 GPT 内的模型进行,告诉你是否产生了 GPT 内的模型降级(例如 6.1 SOL 可能使用 luna 回复),如果你接的是中转站,给你注水成 DS 或者别的模型,随机数测试是分辨不出来的。
    ishengge
        35
    ishengge  
       1h 22m ago
    block, 影响我智商
    laodao
        36
    laodao  
       1h 21m ago
    你家 codex 叫智能机器人?
    fkdtz
        37
    fkdtz  
       1h 21m ago
    不像演的
    Promtheus
        38
    Promtheus  
       1h 19m ago
    50 岁了吧
    keshawnvan
        39
    keshawnvan  
       1h 19m ago
    我用 Astra 改过最大的改动是 68 万行,其中 2 万行是业务改动,剩下都是单元测试+集成测试。
    测试阶段和生产验证都是 0 BUG 。
    firemiles
        40
    firemiles  
       1h 15m ago
    看到用户名 penzi ,真怀疑 up 是不是故意炒话题的
    tim9527
        41
    tim9527  
       1h 12m ago
    不至于。
    nutting
        42
    nutting  
       1h 8m ago
    你这是机器人不是 codex ,更不是 ai
    BRZ001
        43
    BRZ001  
       1h 5m ago
    中转站 注水了兄弟,用原生 codex 吧
    stardew
        44
    stardew  
       1h 4m ago
    😅
    yougg
        45
    yougg  
       59 mins ago
    不要回答! 不要回答! 不要回答!

    这就是来骗铜币的!!!
    aicong2021
        46
    aicong2021  
       57 mins ago
    不太可能,500 行开源 8B 参数的模型应该都能改的动
    yoyoyoyolol
        47
    yoyoyoyolol  
       55 mins ago
    你把这个问题的文本描述打出来,让大家问一下看看答案是不是和你一致,就知道是谁的问题了
    d119
        48
    d119  
       52 mins ago
    改是能改,就是跑不起来
    seanxx
        49
    seanxx  
       50 mins ago
    直接 block 完事,明显装糖骗回复
    413420
        50
    413420  
       49 mins ago
    糖 b
    tcchen
        51
    tcchen  
    PRO
       44 mins ago
    jerseyhero
        52
    jerseyhero  
       39 mins ago
    感觉像在带节奏骗回复
    cropflre
        53
    cropflre  
       36 mins ago
    怕不是中转站接的是豆包模型
    hidemyname
        54
    hidemyname  
       36 mins ago
    @penzi #2 几十万行的代码挺简单???
    iyaozhen
        55
    iyaozhen  
       24 mins ago
    你得在 codex 里面用吧,我们之前测试过不同 harness 框架差异很大

    不知道你那个什么智能机器人是怎么部署的
    Kafuka578
        56
    Kafuka578  
       23 mins ago
    难绷
    ttkit
        57
    ttkit  
       21 mins ago
    TofuBazinga
        58
    TofuBazinga  
       2 mins ago
    看到这个智能机器人绷不住了。。。
    niubilewodev
        59
    niubilewodev  
       1 min ago
    哈哈,‘我写了 99 行脚本和 109 行测试。’
    你用到正品 GPT 了。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Privacy   ·   Solana   ·   5285 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 211ms · UTC 03:51 · PVG 11:51 · LAX 20:51 · JFK 23:51
    ♥ Do have faith in what you're doing.