Skip to content

FreeToken ROCm Watch — notification channel - #1

Draft
Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log
Draft

Castoff995 wants to merge 1 commit into
mainfrom
automation/freetoken-rocm-watch-log

Conversation

@Castoff995

Copy link
Copy Markdown
Owner

Этот PR служит постоянным каналом уведомлений для автоматической проверки GitHub каждые 2 часа. Его не нужно ревьюить, мержить или закрывать, пока слежка нужна.

Высший приоритет

Рабочие форки

  • PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf.
  • Maxritz/FreeToken-rocm-test:main.

Зависимости

  • ROCm/TheRock — Windows/RDNA4/gfx1201 wheels, PyTorch/HIP regressions and releases.
  • triton-lang/triton-windows — Windows AMD/HIP support and releases.
  • apache/tvm-ffi — Windows/HIP JIT and cache/toolchain changes.

Устойчивость модели

Также отслеживаются изменения, способные повлиять на первый токен и практический перевод: Qwen3.6/NVFP4, MoE offload, hybrid_radix, pinned/pageable residency, mapped device pointers, long-prefill/KV-cache hangs and engine crashes.

Уведомление публикуется только при существенном изменении: новый релевантный issue/PR, новый commit в ключевом PR/форке, изменение draft/merge/CI/state, новый релиз либо подтверждённый gfx1201/Windows результат. При отсутствии новостей комментариев не будет.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch запущен. Проверка выполняется каждые 2 часа; при отсутствии существенных изменений комментариев не будет.

Текущий P0 baseline:

Ключевые issues: FreeToken Roadmap (2026), ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please, Native Windows is classified as pin-uncapped, so ROCm/TheRock#112's per-layer residency never auto-engages, Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp.

Дополнительно отслеживаются fork commits, ROCm/TheRock, Triton Windows, TVM-FFI, PyTorch gfx1201, Qwen3.6/NVFP4, mapped host pointers, pin-budget, long-prefill и offload stability.

@github-actions

github-actions Bot commented Aug 24, 2026 •

Copy link
Copy Markdown

{"branches":{"FlashML-org/FreeToken:main":{"branch":"main","date":"2026-10-07T07:15:11Z","message":"feat(deepseek-v41): support text and vision serving (FlashML-org#603)","repo":"FlashML-org/FreeToken","sha":"127c85665b49e39d78a5d09b95a92169b5794eb0","url":"FlashML-org@127c85665b49e39d78a5d09b95a92169b5794eb0"},"Maxritz/FreeToken-rocm-test:main":{"branch":"main","date":"2026-09-20T16:29:33Z","message":"Merge pull request Maxritz#5 from uploadyours/fix/windows-rocm-install-and-qwen35moe-gguf","repo":"Maxritz/FreeToken-rocm-test","sha":"e8545daca33f54069eedd71c8afd8a2ff35380bc","url":"Maxritz@e8545daca33f54069eedd71c8afd8a2ff35380bc"},"PialGhosh2233/FreeToken-rocm-gfx1200:gfx1200-moe-gguf":{"branch":"gfx1200-moe-gguf","date":"2026-08-26T07:51:22Z","message":"docs: Gemma-4-26B-A4B QAT q4_0 GGUF results on gfx1200","repo":"PialGhosh2233/FreeToken-rocm-gfx1200","sha":"a338f49b93e2f098eeb3aa83423c9c5386c53ac4","url":"PialGhosh2233@a338f49b93e2f098eeb3aa83423c9c5386c53ac4"}},"discovered":{"FlashML-org/FreeToken#176%22:%7B%22body_hash%22:%2204e37c143183da8a%22,%22comments%22:4,%22kind%22:%22issue%22,%22number%22:176,%22repo%22:%22FlashML-org/FreeToken%22,%22state%22:%22open%22,%22title%22:%22Feature: Predictive Expert Offloading","updated_at":"2026-10-01T10:46:25Z","url":"https://github.com/FlashML-org/FreeToken/issues/176"},"FlashML-org/FreeToken#239":{"body_hash":"e0d9878137f1a275","comments":3,"kind":"issue","number":239,"repo":"FlashML-org/FreeToken","state":"open","title":"RTX 2050 4GB: Qwen3.6-35B-A3B-NVFP4 runs at ~21 tok/s with single-layer CPU MoE prefill buffer","updated_at":"2026-09-30T11:33:06Z","url":"https://github.com/FlashML-org/FreeToken/issues/239"},"FlashML-org/FreeToken#24":{"body_hash":"04716372ce11a2b6","comments":3,"kind":"pr","number":24,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(cuda): support Turing GPUs","updated_at":"2026-10-01T16:28:42Z","url":"https://github.com/FlashML-org/FreeToken/pull/24"},"FlashML-org/FreeToken#260":{"body_hash":"e0794d434a8a819d","comments":9,"kind":"pr","number":260,"repo":"FlashML-org/FreeToken","state":"open","title":"ROCm: validate native gfx1151 serving on Strix Halo","updated_at":"2026-09-30T15:09:34Z","url":"https://github.com/FlashML-org/FreeToken/pull/260"},"FlashML-org/FreeToken#301":{"body_hash":"40475c88b787fc6e","comments":3,"kind":"issue","number":301,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(server): allow overriding the distributed port","updated_at":"2026-10-06T11:01:11Z","url":"https://github.com/FlashML-org/FreeToken/issues/301"},"FlashML-org/FreeToken#302":{"body_hash":"53ce92fba4ae82bc","comments":4,"kind":"issue","number":302,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(server): add a server-side thinking override","updated_at":"2026-09-29T17:06:47Z","url":"https://github.com/FlashML-org/FreeToken/issues/302"},"FlashML-org/FreeToken#335":{"body_hash":"42a24e63af908edf","comments":1,"kind":"issue","number":335,"repo":"FlashML-org/FreeToken","state":"open","title":"[Bug] b12x NVFP4 backend on sm_120 (RTX 5090) serves batch 1 only: not CUDA-graph capturable, and the worker dies with a tile-config ValueError at batch >= 2 (Qwen3.8-Flash-Next-NVFP4)","updated_at":"2026-10-06T07:11:43Z","url":"https://github.com/FlashML-org/FreeToken/issues/335"},"FlashML-org/FreeToken#338":{"body_hash":"d03533086a4e931f","comments":6,"kind":"pr","number":338,"repo":"FlashML-org/FreeToken","state":"closed","title":"perf(ple): fuse the n-gram row-id hash into one Triton kernel","updated_at":"2026-10-04T11:41:35Z","url":"https://github.com/FlashML-org/FreeToken/pull/338"},"FlashML-org/FreeToken#339":{"body_hash":"7d0f17426b165cb7","comments":4,"kind":"pr","number":339,"repo":"FlashML-org/FreeToken","state":"closed","title":"fix(kernels): drop the D2H sync from the varlen GDN/KDA prefill conv","updated_at":"2026-10-04T11:41:36Z","url":"https://github.com/FlashML-org/FreeToken/pull/339"},"FlashML-org/FreeToken#340":{"body_hash":"4c2febbad30c626f","comments":1,"kind":"pr","number":340,"repo":"FlashML-org/FreeToken","state":"closed","title":"fix(engine): reserve the pool's dummy page in the --moe-cache-auto KV floor","updated_at":"2026-10-04T11:41:36Z","url":"https://github.com/FlashML-org/FreeToken/pull/340"},"FlashML-org/FreeToken#384":{"body_hash":"a5cfef075e1a00c8","comments":3,"kind":"issue","number":384,"repo":"FlashML-org/FreeToken","state":"open","title":"Build on Windows?","updated_at":"2026-09-30T14:31:07Z","url":"https://github.com/FlashML-org/FreeToken/issues/384"},"FlashML-org/FreeToken#390":{"body_hash":"a2503c9f178eed1b","comments":9,"kind":"pr","number":390,"repo":"FlashML-org/FreeToken","state":"closed","title":"fix(models): better support for mixed-precision compressed-tensors NVFP4","updated_at":"2026-10-07T02:20:53Z","url":"https://github.com/FlashML-org/FreeToken/pull/390"},"FlashML-org/FreeToken#399":{"body_hash":"227a0901fd907e75","comments":2,"kind":"pr","number":399,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(cpu-moe): honor padded fp8 scale strides, add avx512f tier and float64 parity (builds on FlashML-org#36)","updated_at":"2026-10-05T06:31:21Z","url":"https://github.com/FlashML-org/FreeToken/pull/399"},"FlashML-org/FreeToken#409":{"body_hash":"ae748f8c8ddac88b","comments":6,"kind":"issue","number":409,"repo":"FlashML-org/FreeToken","state":"open","title":"Qwen3.8-Flash-Next-NVFP4 cannot start on a 12 GB RTX 3060: ~9.9 GiB of unquantized (BF16) attention/embedding weights leave no room for MoE cache + KV","updated_at":"2026-10-06T07:11:46Z","url":"https://github.com/FlashML-org/FreeToken/issues/409"},"FlashML-org/FreeToken#444":{"body_hash":"97cdf976b5f6c886","comments":6,"kind":"issue","number":444,"repo":"FlashML-org/FreeToken","state":"open","title":"[Model] DeepSeek-V4.1-Flash (deepseek_v41) — hybrid CPU-MoE makes it viable on a single GPU, and Engram is already isolated in 2 shards","updated_at":"2026-10-05T06:43:15Z","url":"https://github.com/FlashML-org/FreeToken/issues/444"},"FlashML-org/FreeToken#460":{"body_hash":"efe5429c0d3bc8aa","comments":2,"kind":"pr","number":460,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(models): support deepseek v4.1 with native fp8-fp4 kv storage","updated_at":"2026-10-05T06:50:13Z","url":"https://github.com/FlashML-org/FreeToken/pull/460"},"FlashML-org/FreeToken#534":{"body_hash":"265c914cd1ae1994","comments":4,"kind":"issue","number":534,"repo":"FlashML-org/FreeToken","state":"open","title":"FP8 block-quantized MoE models have no usable kernel under moe_strategy=offload (0.1.3)","updated_at":"2026-10-05T06:32:52Z","url":"https://github.com/FlashML-org/FreeToken/issues/534"},"FlashML-org/FreeToken#538":{"body_hash":"aa31212e0c6a4476","comments":3,"kind":"issue","number":538,"repo":"FlashML-org/FreeToken","state":"open","title":"RTX 3090 device loss (Xid 79) at --max-prefill-length 8192 in offload mode — known limitation, or host-specific?","updated_at":"2026-09-30T14:30:39Z","url":"https://github.com/FlashML-org/FreeToken/issues/538"},"FlashML-org/FreeToken#556":{"body_hash":"78df67c573b9e18a","comments":1,"kind":"issue","number":556,"repo":"FlashML-org/FreeToken","state":"closed","title":"[Desktop] weights failed to load: Qwen3.6-27B NVFP4","updated_at":"2026-10-05T06:28:37Z","url":"https://github.com/FlashML-org/FreeToken/issues/556"},"FlashML-org/FreeToken#561":{"body_hash":"effac85bee1affd0","comments":2,"kind":"issue","number":561,"repo":"FlashML-org/FreeToken","state":"open","title":"Bug: AssertionError: Not enough memory for KV cache when serving Qwen3.8-27B-NVFP4 on Windows","updated_at":"2026-10-02T12:42:09Z","url":"https://github.com/FlashML-org/FreeToken/issues/561"},"FlashML-org/FreeToken#566":{"body_hash":"2c540d2c236623f4","comments":0,"kind":"issue","number":566,"repo":"FlashML-org/FreeToken","state":"closed","title":"QSA block top-k runs a 1M-token window on one program per row","updated_at":"2026-09-29T23:29:18Z","url":"https://github.com/FlashML-org/FreeToken/issues/566"},"FlashML-org/FreeToken#567":{"body_hash":"6af3e9c4ead76444","comments":0,"kind":"issue","number":567,"repo":"FlashML-org/FreeToken","state":"open","title":"A stream that is silent through a long prefill is dropped by Node clients and prefilled for nobody","updated_at":"2026-09-29T17:06:19Z","url":"https://github.com/FlashML-org/FreeToken/issues/567"},"FlashML-org/FreeToken#568":{"body_hash":"f836f522139aa72f","comments":0,"kind":"issue","number":568,"repo":"FlashML-org/FreeToken","state":"open","title":"Serving Qwen3.8-Flash-Next's 1M-token window on one 24 GB card","updated_at":"2026-09-29T17:06:55Z","url":"https://github.com/FlashML-org/FreeToken/issues/568"},"FlashML-org/FreeToken#569":{"body_hash":"194b687889102bba","comments":0,"kind":"issue","number":569,"repo":"FlashML-org/FreeToken","state":"open","title":"A hybrid model's cached prefix cannot be resumed far back: no GDN snapshot survives below a prompt's last chunk","updated_at":"2026-09-29T17:06:23Z","url":"https://github.com/FlashML-org/FreeToken/issues/569"},"FlashML-org/FreeToken#570":{"body_hash":"ccadf4bf679191a5","comments":0,"kind":"issue","number":570,"repo":"FlashML-org/FreeToken","state":"open","title":"On Windows the engine sizes its pools as if no other process held any of the card","updated_at":"2026-09-29T17:06:25Z","url":"https://github.com/FlashML-org/FreeToken/issues/570"},"FlashML-org/FreeToken#571":{"body_hash":"a819c75f8b1f5624","comments":1,"kind":"pr","number":571,"repo":"FlashML-org/FreeToken","state":"closed","title":"perf(qsa): reduce block top-k candidates in levels past 16 splits","updated_at":"2026-09-30T14:30:56Z","url":"https://github.com/FlashML-org/FreeToken/pull/571"},"FlashML-org/FreeToken#572":{"body_hash":"57db1db2add83ffd","comments":0,"kind":"pr","number":572,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(server): keep a silent stream alive and notice a client that left","updated_at":"2026-10-06T10:54:30Z","url":"https://github.com/FlashML-org/FreeToken/pull/572"},"FlashML-org/FreeToken#573":{"body_hash":"d90bc09fa5c00943","comments":3,"kind":"pr","number":573,"repo":"FlashML-org/FreeToken","state":"closed","title":"feat(rotary): size the rope table for YaRN and add --hf-overrides","updated_at":"2026-10-01T07:40:28Z","url":"https://github.com/FlashML-org/FreeToken/pull/573"},"FlashML-org/FreeToken#574":{"body_hash":"eb71c7864dfdb816","comments":0,"kind":"pr","number":574,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(engine): --vram-reserve-mb keeps VRAM free at the largest prefill","updated_at":"2026-10-06T11:00:25Z","url":"https://github.com/FlashML-org/FreeToken/pull/574"},"FlashML-org/FreeToken#575":{"body_hash":"84c166abd171effb","comments":0,"kind":"pr","number":575,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(windows): build the extensions and JIT kernels with MSVC","updated_at":"2026-10-06T11:00:27Z","url":"https://github.com/FlashML-org/FreeToken/pull/575"},"FlashML-org/FreeToken#577":{"body_hash":"fb43cf2047e6f67b","comments":3,"kind":"pr","number":577,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(kvcache): keep prefill-chunk GDN checkpoints in a pinned host bank","updated_at":"2026-10-03T04:38:11Z","url":"https://github.com/FlashML-org/FreeToken/pull/577"},"FlashML-org/FreeToken#578":{"body_hash":"129b1abb2df0c38e","comments":0,"kind":"pr","number":578,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(moe): dequant nvfp4 prefill experts by bit placement and load activations contiguously","updated_at":"2026-10-06T11:00:29Z","url":"https://github.com/FlashML-org/FreeToken/pull/578"},"FlashML-org/FreeToken#579":{"body_hash":"8b996dedc8b58ce6","comments":0,"kind":"issue","number":579,"repo":"FlashML-org/FreeToken","state":"open","title":"An offloaded prefill streams every expert of each layer, however short the chunk","updated_at":"2026-09-30T14:30:36Z","url":"https://github.com/FlashML-org/FreeToken/issues/579"},"FlashML-org/FreeToken#580":{"body_hash":"fbb775a52b247fad","comments":0,"kind":"pr","number":580,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(windows): serve over loopback ZMQ and a selector event loop","updated_at":"2026-10-06T11:00:32Z","url":"https://github.com/FlashML-org/FreeToken/pull/580"},"FlashML-org/FreeToken#581":{"body_hash":"31d2cefc49b9a275","comments":0,"kind":"pr","number":581,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(windows): read checkpoints without O_DIRECT, posix_fadvise or PROT_READ","updated_at":"2026-10-06T10:54:53Z","url":"https://github.com/FlashML-org/FreeToken/pull/581"},"FlashML-org/FreeToken#583":{"body_hash":"bb0f92f655d6f410","comments":0,"kind":"pr","number":583,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(engine): size memory pools against the VRAM other processes leave free on Windows","updated_at":"2026-10-06T11:00:35Z","url":"https://github.com/FlashML-org/FreeToken/pull/583"},"FlashML-org/FreeToken#584":{"body_hash":"00499fe994d84ba6","comments":0,"kind":"issue","number":584,"repo":"FlashML-org/FreeToken","state":"open","title":"The computer on the local area network cannot be accessed","updated_at":"2026-09-30T15:54:22Z","url":"https://github.com/FlashML-org/FreeToken/issues/584"},"FlashML-org/FreeToken#585":{"body_hash":"bc29701a8b518529","comments":0,"kind":"pr","number":585,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(linear): run a single-row bf16 projection as one GEMV","updated_at":"2026-10-06T10:54:46Z","url":"https://github.com/FlashML-org/FreeToken/pull/585"},"FlashML-org/FreeToken#587":{"body_hash":"7e6929aa54eb0c69","comments":1,"kind":"pr","number":587,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(rocm): run on RDNA3/RDNA4 with torch 2.14/2.15 and ROCm 7.14/10","updated_at":"2026-10-05T16:16:21Z","url":"https://github.com/FlashML-org/FreeToken/pull/587"},"FlashML-org/FreeToken#588":{"body_hash":"611f86536843cd1d","comments":0,"kind":"pr","number":588,"repo":"FlashML-org/FreeToken","state":"closed","title":"fix(ple): fence disk staging against in-flight lookups","updated_at":"2026-10-01T23:59:45Z","url":"https://github.com/FlashML-org/FreeToken/pull/588"},"FlashML-org/FreeToken#589":{"body_hash":"3545d2d7d7856bb6","comments":0,"kind":"pr","number":589,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(checkpoint): resolve HF repo Ids before conversion","updated_at":"2026-10-02T08:52:03Z","url":"https://github.com/FlashML-org/FreeToken/pull/589"},"FlashML-org/FreeToken#590":{"body_hash":"05469569baac50e7","comments":0,"kind":"pr","number":590,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(model): fuse hc combine with the next block's RMSNorm","updated_at":"2026-10-02T22:44:15Z","url":"https://github.com/FlashML-org/FreeToken/pull/590"},"FlashML-org/FreeToken#594":{"body_hash":"b03118a468b33c59","comments":0,"kind":"pr","number":594,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(qwen4_exp): support ModelOpt QAD checkpoints (NVFP4 PLE tables, MXFP8 dense)","updated_at":"2026-10-03T16:27:55Z","url":"https://github.com/FlashML-org/FreeToken/pull/594"},"FlashML-org/FreeToken#595":{"body_hash":"f619a84581dec764","comments":1,"kind":"pr","number":595,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(server): add ft info and a pre-load memory preflight","updated_at":"2026-10-05T15:37:08Z","url":"https://github.com/FlashML-org/FreeToken/pull/595"},"FlashML-org/FreeToken#596":{"body_hash":"24b00ae8fdb7ece2","comments":0,"kind":"pr","number":596,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(engine): --embed-device cpu keeps the input embedding in RAM","updated_at":"2026-10-04T01:34:09Z","url":"https://github.com/FlashML-org/FreeToken/pull/596"},"FlashML-org/FreeToken#597":{"body_hash":"c34a9a260da47f5f","comments":2,"kind":"issue","number":597,"repo":"FlashML-org/FreeToken","state":"open","title":"[Windows][Desktop] WeightLoadError: invalid python storage with Qwen3.6 NVFP4 and gpt-oss-20b MXFP4","updated_at":"2026-10-05T18:24:01Z","url":"https://github.com/FlashML-org/FreeToken/issues/597"},"FlashML-org/FreeToken#601":{"body_hash":"fdf19066450ceb13","comments":0,"kind":"pr","number":601,"repo":"FlashML-org/FreeToken","state":"closed","title":"feat(moe): serve NVFP4 and MXFP4 experts fused through the expert banks","updated_at":"2026-10-04T20:51:56Z","url":"https://github.com/FlashML-org/FreeToken/pull/601"},"FlashML-org/FreeToken#605":{"body_hash":"f03f9e77e023cc60","comments":0,"kind":"pr","number":605,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(pre-sm70): pipeline the block-fp8 GEMMs and halve the extend-attention K/V re-reads on Pascal","updated_at":"2026-10-05T16:31:10Z","url":"https://github.com/FlashML-org/FreeToken/pull/605"},"FlashML-org/FreeToken#606":{"body_hash":"12d688e163f0e273","comments":1,"kind":"issue","number":606,"repo":"FlashML-org/FreeToken","state":"open","title":"DeepSeek-V4-Flash-0731-NVFP4 (nvidia) fails on 0.1.3+gfa0e9537d: WeightLoadError KeyError 'layers.0.ffn.experts.0.w1.scale'","updated_at":"2026-10-06T02:19:42Z","url":"https://github.com/FlashML-org/FreeToken/issues/606"},"FlashML-org/FreeToken#607":{"body_hash":"5800e5a7dd83d2d0","comments":1,"kind":"issue","number":607,"repo":"FlashML-org/FreeToken","state":"open","title":"Windows wheels resolve unpinned torch dependency to CPU-only build: 'cannot use CUDA device 0: only 0 device(s) visible'","updated_at":"2026-10-05T22:53:59Z","url":"https://github.com/FlashML-org/FreeToken/issues/607"},"FlashML-org/FreeToken#608":{"body_hash":"18c66c42155be45a","comments":0,"kind":"pr","number":608,"repo":"FlashML-org/FreeToken","state":"closed","title":"fix(server): keep Anthropic inline system messages in place for prefix reuse","updated_at":"2026-10-05T22:00:00Z","url":"https://github.com/FlashML-org/FreeToken/pull/608"},"FlashML-org/FreeToken#609":{"body_hash":"071a4e2fb7588698","comments":0,"kind":"pr","number":609,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(models): preserve glm-5.2 router correction bias in fp32","updated_at":"2026-10-05T22:57:35Z","url":"https://github.com/FlashML-org/FreeToken/pull/609"},"FlashML-org/FreeToken#610":{"body_hash":"a9262becc4676eab","comments":5,"kind":"pr","number":610,"repo":"FlashML-org/FreeToken","state":"closed","title":"perf(moe): Improved fast_index_copy_multi_jit for NVLink-C2C hosts (GH200: 222 → 412 GB/s)","updated_at":"2026-10-07T02:54:39Z","url":"https://github.com/FlashML-org/FreeToken/pull/610"},"FlashML-org/FreeToken#611":{"body_hash":"b5243c0b22682524","comments":0,"kind":"issue","number":611,"repo":"FlashML-org/FreeToken","state":"open","title":"GLM-5.3-Flash-NVFP4 CUDA OOM during load on RTX 5070 Ti 16 GB (sm_120)","updated_at":"2026-10-06T07:11:57Z","url":"https://github.com/FlashML-org/FreeToken/issues/611"},"FlashML-org/FreeToken#612":{"body_hash":"44f6d4e3229a047d","comments":0,"kind":"pr","number":612,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(moe): route moe_align to the atomic-free staged path below sm_70","updated_at":"2026-10-06T10:41:03Z","url":"https://github.com/FlashML-org/FreeToken/pull/612"},"FlashML-org/FreeToken#613":{"body_hash":"e09232c609ed4deb","comments":0,"kind":"pr","number":613,"repo":"FlashML-org/FreeToken","state":"open","title":"fix(server)!: answer /health with 503 until the server accepts requests","updated_at":"2026-10-06T11:00:46Z","url":"https://github.com/FlashML-org/FreeToken/pull/613"},"FlashML-org/FreeToken#617":{"body_hash":"b3c1a5f65561a2c8","comments":0,"kind":"pr","number":617,"repo":"FlashML-org/FreeToken","state":"open","title":"perf(fla): fix the pre-sm70 GDN chunk-kernel launch configs (7.4x / 11.3x)","updated_at":"2026-10-06T17:34:53Z","url":"https://github.com/FlashML-org/FreeToken/pull/617"},"FlashML-org/FreeToken#618":{"body_hash":"6704be182c9af027","comments":0,"kind":"pr","number":618,"repo":"FlashML-org/FreeToken","state":"open","title":"feat(attention): hand-written GQA-fused extend kernel for pre-sm70 (1.8x)","updated_at":"2026-10-06T17:35:09Z","url":"https://github.com/FlashML-org/FreeToken/pull/618"},"FlashML-org/FreeToken#619":{"body_hash":"5afe0636b926dc33","comments":2,"kind":"pr","number":619,"repo":"FlashML-org/FreeToken","state":"closed","title":"perf(moe): spin-wait the cpu moe pool between layers","updated_at":"2026-10-07T04:38:11Z","url":"https://github.com/FlashML-org/FreeToken/pull/619"}},"errors":["dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 4845:1683C0:FBE78:16CDA3:6AC60612 and timestamp 2026-10-07 08:42:58 UTC. For more on scraping GitHub and how it may affect your rights, please review our Terms of Service (https://docs.github.com/en/site-policy/github-terms/github-terms-of-service)"],"external_tracked_issues":{"ROCm/legacy-rocm-build#6461":{"body_hash":"0ac6e80ee9b489cd","comments":6,"kind":"issue","number":6461,"relevance":"high","relevance_reason":"Windows + gfx1201 + hipBLASLt/rocBLAS sequence/state-dependent GEMM failure","repo":"ROCm/legacy-rocm-build","state":"closed","title":"[Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14","updated_at":"2026-09-23T17:39:44Z","url":"https://github.com/ROCm/legacy-rocm-build/issues/6461"}},"last_checked":"2026-10-07T08:42:27+00:00","releases":{"FlashML-org/FreeToken":{"draft":false,"name":"v0.1.3","prerelease":false,"published_at":"2026-09-16T01:02:33Z","tag":"v0.1.3","url":"https://github.com/FlashML-org/FreeToken/releases/tag/v0.1.3"},"ROCm/ROCm":{"draft":false,"name":"ROCm 7.14.0 Release","prerelease":false,"published_at":"2026-07-16T03:28:58Z","tag":"rocm-7.14.0","url":"https://github.com/ROCm/legacy-rocm-build/releases/tag/rocm-7.14.0"},"ROCm/TheRock":{"draft":false,"name":"","prerelease":false,"published_at":"2026-10-05T10:42:56Z","tag":"therock-10.1","url":"https://github.com/ROCm/TheRock/releases/tag/therock-10.1"},"apache/tvm-ffi":{"draft":false,"name":"v0.1.14-post1","prerelease":false,"published_at":"2026-09-22T12:36:48Z","tag":"v0.1.14-post1","url":"https://github.com/apache/tvm-ffi/releases/tag/v0.1.14-post1"},"ggml-org/llama.cpp":{"draft":false,"name":"v0.6.0","prerelease":false,"published_at":"2026-10-05T16:56:22Z","tag":"v0.6.0","url":"https://github.com/ggml-org/llama.cpp/releases/tag/v0.6.0"},"triton-lang/triton-windows":{"draft":false,"name":"v3.8.0-windows.post29","prerelease":false,"published_at":"2026-09-28T22:00:36Z","tag":"v3.8.0-windows.post29","url":"https://github.com/triton-lang/triton-windows/releases/tag/v3.8.0-windows.post29"}},"tracked_issues":{"110":{"body_hash":"d6672f16a90f2854","comments":3,"kind":"issue","number":110,"repo":"FlashML-org/FreeToken","state":"open","title":"Unhandled CUDA OOM in prefill expert workspace kills the engine; server keeps accepting requests that never return (root cause behind FlashML-org#20-style headless state; likely also FlashML-org#72)","updated_at":"2026-10-06T10:03:58Z","url":"https://github.com/FlashML-org/FreeToken/issues/110"},"111":{"body_hash":"b01b977d143435c7","comments":3,"kind":"issue","number":111,"repo":"FlashML-org/FreeToken","state":"open","title":"Requests longer than the KV pool are queued forever with no error — and --moe-cache-auto leaves only ~8k tokens of KV on a 96GB GPU","updated_at":"2026-08-31T02:09:35Z","url":"https://github.com/FlashML-org/FreeToken/issues/111"},"120":{"body_hash":"a7caa8c0bca18470","comments":1,"kind":"issue","number":120,"repo":"FlashML-org/FreeToken","state":"open","title":"Native Windows is classified as pin-uncapped, so FlashML-org#112's per-layer residency never auto-engages","updated_at":"2026-08-24T03:04:21Z","url":"https://github.com/FlashML-org/FreeToken/issues/120"},"122":{"body_hash":"4d42515b782747ed","comments":6,"kind":"issue","number":122,"repo":"FlashML-org/FreeToken","state":"open","title":"Windows/ROCm on RX 9060 XT (gfx1200): packed GGUF working end-to-end (dense + MoE), root cause of the RDNA4 offload-decode TDR, benchmarks vs llama.cpp","updated_at":"2026-08-27T07:18:05Z","url":"https://github.com/FlashML-org/FreeToken/issues/122"},"123":{"body_hash":"09dd1b9b8cf6560f","comments":1,"kind":"issue","number":123,"repo":"FlashML-org/FreeToken","state":"closed","title":"Request hang (silent, zero-log) with hybrid_radix cache + moe-backend offload + nvfp4 triton backend — reproduced on 2 independent models, not explained by FlashML-org#110","updated_at":"2026-08-29T05:13:10Z","url":"https://github.com/FlashML-org/FreeToken/issues/123"},"124":{"body_hash":"64a1de8500f135a3","comments":0,"kind":"issue","number":124,"repo":"FlashML-org/FreeToken","state":"closed","title":"NVFP4 checkpoints fail to load: model.safetensors.index.json is not downloaded, but the NVFP4 bank loader requires it","updated_at":"2026-09-02T02:43:20Z","url":"https://github.com/FlashML-org/FreeToken/issues/124"},"79":{"body_hash":"1bc2e650d72ca13e","comments":17,"kind":"issue","number":79,"repo":"FlashML-org/FreeToken","state":"open","title":"FreeToken Roadmap (2026)","updated_at":"2026-10-06T17:57:47Z","url":"https://github.com/FlashML-org/FreeToken/issues/79"},"82":{"body_hash":"ff59a7ff00722b01","comments":19,"kind":"issue","number":82,"repo":"FlashML-org/FreeToken","state":"open","title":"ROCm RDNA4 gfx1201 Ported. Windows only for now. Test please","updated_at":"2026-09-15T15:50:45Z","url":"https://github.com/FlashML-org/FreeToken/issues/82"}},"tracked_prs":{"112":{"base_sha":"f0abe587a11cca53bb3c37a9596fad24973ace62","body_hash":"aa539235301fea3d","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":3,"draft":false,"head_sha":"831d38a66bc45543411078c6805de8c42e7603fa","merged":true,"number":112,"review_comments":0,"state":"closed","title":"feat(moe): per-layer host-bank residency","updated_at":"2026-08-24T00:39:32Z","url":"https://github.com/FlashML-org/FreeToken/pull/112"},"118":{"base_sha":"e0a3bbc04652ec0622d932adcbf2772848e3c2e2","body_hash":"d73a76c00cdb2f94","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"6241178a7550e5a0ffadd85f0eb04af0160f9988","merged":false,"number":118,"review_comments":0,"state":"open","title":"fix(scheduler): clamp admission to the actual KV pool so oversized prompts fail loudly","updated_at":"2026-08-24T00:52:33Z","url":"https://github.com/FlashML-org/FreeToken/pull/118"},"125":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"793491958f083651","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"cb44bdeedb7ea6ed2b37c5c49864ad40065e1985","merged":false,"number":125,"review_comments":0,"state":"open","title":"test(pinned): use mapped memory for UVA pointer check","updated_at":"2026-08-24T05:48:44Z","url":"https://github.com/FlashML-org/FreeToken/pull/125"},"129":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"d5c4ac29d87557fc","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":3,"commits":1,"draft":false,"head_sha":"d30726e006b2708d4fbfead120985bc23c935541","merged":false,"number":129,"review_comments":0,"state":"closed","title":"fix(download): include json files when fetching weights, so NVFP4's index.json is no longer silently skipped","updated_at":"2026-09-02T02:45:39Z","url":"https://github.com/FlashML-org/FreeToken/pull/129"},"131":{"base_sha":"bd372b630a028e3faa51f4ab0ef6a98c2f2de501","body_hash":"33bc52d171e8ca00","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":8,"commits":36,"draft":false,"head_sha":"bb432e8c473c557cdef6517abccf0c129bd8c544","merged":false,"number":131,"review_comments":0,"state":"open","title":"GGUF: support all quant types, add qwen35moe","updated_at":"2026-08-29T22:27:37Z","url":"https://github.com/FlashML-org/FreeToken/pull/131"},"132":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"f5b92547538a8571","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":8,"commits":11,"draft":false,"head_sha":"c6be4afb541b34f36fb811cd2f6efc01784e9e5d","merged":true,"number":132,"review_comments":7,"state":"closed","title":"feat(rocm): add RDNA3 and RDNA4 runtime foundation","updated_at":"2026-09-26T00:49:46Z","url":"https://github.com/FlashML-org/FreeToken/pull/132"},"133":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"eb17018abe601f2c","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":11,"draft":true,"head_sha":"9ec8271ab0b824246944f7f23c9e819185ac44b3","merged":false,"number":133,"review_comments":0,"state":"open","title":"fix(rocm): make TVM-FFI index and store JIT kernels portable to HIP","updated_at":"2026-09-21T03:01:45Z","url":"https://github.com/FlashML-org/FreeToken/pull/133"},"134":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"467c9a375cece285","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":1,"commits":11,"draft":true,"head_sha":"c4f4a36e945a7c13f4f5b500eb2e6a8e07183d4c","merged":false,"number":134,"review_comments":0,"state":"open","title":"fix(rocm): gate CUDA-only optional backends on ROCm","updated_at":"2026-09-21T03:01:49Z","url":"https://github.com/FlashML-org/FreeToken/pull/134"},"135":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"3a0be6c359e61828","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":5,"commits":12,"draft":true,"head_sha":"3675d03e17110adfcaa532cc965e5c79895cc8f3","merged":false,"number":135,"review_comments":0,"state":"open","title":"fix(rocm): route tensor parallel communication through RCCL","updated_at":"2026-10-06T10:49:08Z","url":"https://github.com/FlashML-org/FreeToken/pull/135"},"136":{"base_sha":"cc1f5c2c91855f2cc7787ad6b909f7e46a5d5825","body_hash":"c875bbbd1cb60d21","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":5,"commits":13,"draft":true,"head_sha":"76bf2ac398464f8762148356b4a4019e3327b2a9","merged":false,"number":136,"review_comments":0,"state":"closed","title":"feat(rocm): enable native GGUF kernels on ROCm (validated on RDNA4)","updated_at":"2026-09-24T06:02:29Z","url":"https://github.com/FlashML-org/FreeToken/pull/136"},"137":{"base_sha":"f7c31e92dbf296de3a5bb1b9c5fcb58f988e3a07","body_hash":"a0597a23e4607628","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":0,"commits":1,"draft":false,"head_sha":"5eec2582ce89376e3f5016d47ff73ca1b4e8d445","merged":false,"number":137,"review_comments":0,"state":"open","title":"feat(rocm): serve on AMD GPUs through the HIP toolchain","updated_at":"2026-08-26T09:03:28Z","url":"https://github.com/FlashML-org/FreeToken/pull/137"},"27":{"base_sha":"0ab982f10905fa775962a4eddcb44caa50065251","body_hash":"e85637efb5176c06","checks":{"failed":[],"pending":[],"state":"pending","total":0},"comments":4,"commits":1,"draft":false,"head_sha":"d76d5e0105235e9f13edd534fec3dfa86f25cb15","merged":false,"number":27,"review_comments":0,"state":"closed","title":"feat(moe): partial-pin serving to beat the Windows/WSL2 pinned-memory quota (--pin-exempt-layers)","updated_at":"2026-08-24T01:28:09Z","url":"https://github.com/FlashML-org/FreeToken/pull/27"}},"version":1}

Technical baseline updated automatically: 2026-10-07T08:42:27+00:00. This comment is edited in place and does not represent a notification.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T15:02:31+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T16:56:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T18:31:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T19:01:35+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T20:49:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-24T22:45:58+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T01:53:38+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T03:13:46+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T04:55:02+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T07:09:50+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T09:01:32+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T10:51:05+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T11:11:49+00:00).

  • Новый явно отслеживаемый external issue: [Issue]: rocBLAS bf16/f16 GEMM fails with hipErrorInvalidValue on 2nd call, gfx1201 / Windows / ROCm 7.14. High relevance.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 8024:3880E4:B12B:25494:6A8D788F and timestamp 2026-08-25 11:12:15 UTC. For…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T13:13:08+00:00).

  • feat(rocm): add RDNA3 and RDNA4 runtime foundation: обновлены описание/review/discussion (comments 1→2, review 0→0).
  • Новый релевантный issue: Feature: Predictive Expert Offloading.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID F440:3A3DE2:D8F1C6:2D7E43E:6A8D950E and timestamp 2026-08-25 13:13:50 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T15:07:11+00:00).

  • FreeToken Roadmap (2026): comments 5→6.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0407:272BC6:1AC4A9F:5964A5E:6A8DAFBB and timestamp 2026-08-25 15:07:39 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T16:57:34+00:00).

  • Model catalog shows models the local machine cannot run (no capability pre-check before display): обновлён (state open→open, comments 0→1).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 283F:2B3BAA:2009A4A:6A360EB:6A8DC9A1 and timestamp 2026-08-25 16:58:09 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T18:58:44+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T20:47:37+00:00).

  • fix(deps): use PyTorch 2.13 to fix SM89 hangs: обновлён (state open→open, comments 0→0).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 7830:16ACDE:3C41178:CA29304:6A8DFF87 and timestamp 2026-08-25 20:48:07 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-25T22:46:42+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T01:59:36+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T03:19:34+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T04:57:21+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T07:10:22+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T09:04:06+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T10:52:44+00:00).

  • Новый релевантный pr: feat(models): add Qwen3-Next-80B-A3B support.
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 3→5).
  • Новый релиз: ROCm/TheRock therock-10.0.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID B008:2BB36A:73A408:77B54F:6A8EC59E and timestamp 2026-08-26 10:53:18 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T13:18:13+00:00).

  • FreeToken Roadmap (2026): comments 6→7.
  • Feature request: AMD GPU support: обновлён (state open→open, comments 11→12).
  • feat(models): support TP for qwen3_5_moe: обновлён (state open→open, comments 5→7).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 0400:15153F:A5D123:230714B:6A8EE7C0 and timestamp 2026-08-26 13:18:56 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-08-26T15:55:00+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-29T22:17:53+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-30T05:35:41+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-30T12:38:14+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-30T19:22:58+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-09-30T23:52:30+00:00).

  • feat(rotary): size the rope table for YaRN and add --hf-overrides: обновлён (state open→open, comments 0→1).
  • Feature: Predictive Expert Offloading: обновлён (state open→open, comments 2→3).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID DC21:1F03:783509:18CA8FE:6ABDA0E2 and timestamp 2026-09-30 23:53:06 UTC. F…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-01T05:59:01+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 280E:0C59:10BD24:181AE3:6ABDF6C6 and timestamp 2026-10-01 05:59:34 UTC. Fo…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-01T13:20:11+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-01T19:33:14+00:00).

  • Новый релевантный pr: fix(cuda): support Turing GPUs.
  • Новый релевантный pr: feat(rocm): run on RDNA3/RDNA4 with torch 2.14/2.15 and ROCm 7.14/10.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 841B:2FD95D:8690D0:1B9F020:6ABEB5A0 and timestamp 2026-10-01 19:33:52 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 1, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-01T23:54:12+00:00).

  • Новый релевантный pr: fix(ple): fence disk staging against in-flight lookups.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID B7C9:2407CC:1CB4D4:262F99:6ABEF2BD and timestamp 2026-10-01 23:54:37 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-02T05:41:20+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-02T12:39:16+00:00).

  • Новый релевантный pr: fix(checkpoint): resolve HF repo Ids before conversion.
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 3805:2B00BF:D3AB8:103004:6ABFA614 and timestamp 2026-10-02 12:39:48 UTC. F…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-02T19:21:01+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 2, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-02T23:48:42+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-03T05:21:21+00:00).

  • feat(kvcache): keep prefill-chunk GDN checkpoints in a pinned host bank: обновлён (state open→open, comments 2→3).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 9C31:2A54B5:1DCC3:63ABB:6AC090E8 and timestamp 2026-10-03 05:21:44 UTC. Fo…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-03T11:42:13+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 7807:2638C8:36CEA5:B589E6:6AC0EA2E and timestamp 2026-10-03 11:42:38 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-03T16:19:33+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 6841:198B6C:152CB3C:45C13DA:6AC12B3A and timestamp 2026-10-03 16:20:10 UTC…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 3, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-03T21:19:03+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-04T00:39:58+00:00).

  • feat(server): add ft info and a pre-load memory preflight: обновлён (state open→open, comments 0→1).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID E3C7:2F195D:438424:DD3723:6AC1A076 and timestamp 2026-10-04 00:40:22 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-04T08:28:33+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-04T15:23:38+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-04T19:39:36+00:00).

  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID C009:8DB83:354BA3E:B161B1D:6AC2AB90 and timestamp 2026-10-04 19:40:00 UTC.…

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 4, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-04T23:11:57+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-05T05:44:54+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-05T14:44:50+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 5, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-05T22:39:39+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 6, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-06T06:24:26+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 6, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-06T15:13:59+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 6, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-06T21:00:05+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 7, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-07T01:34:15+00:00).

  • perf(moe): Improved fast_index_copy_multi_jit for NVLink-C2C hosts (GH200: 222 → 412 GB/s): обновлён (state open→open, comments 2→3).
  • ⚠️ Новый сбой части мониторинга: dependency discovery: ApiError: GET https://api.github.com/search/issues?q=repo%3Aggml-org/llama.cpp%20MUL_MAT&sort=updated&order=desc&per_page=20: HTTP 403: API rate limit exceeded for installation. If you reach out to GitHub Support for help, please include the request ID 781C:36FE9D:3B7DE9:C45B31:6AC5A1C0 and timestamp 2026-10-07 01:34:56 UTC. …

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

@github-actions

github-actions Bot commented Oct 7, 2026

Copy link
Copy Markdown

@Castoff995 FreeToken ROCm Watch: обнаружены существенные изменения (2026-10-07T08:42:27+00:00).

Перед следующим Codex-таском стоит сначала сверить эти изменения с текущим blocker/патчем.

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant