{"as_of":"2026-08-10T19:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51ec21215c887d06c2c3b3e648cc34c81cf4206a434a68367a1ce980f60e605b","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:40:42.454078Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01034/citation-record","integrity":"/paper/2608.01034/integrity","json":"/paper/2608.01034/citation-record.json","paper":"/paper/2608.01034"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-06T00:40:38.019213Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.019213Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:b5348fbf6037bd1eeaa6067558a670cac809d5ca244355e873feff0bd7541b44","observation_id":"26254f2f-6208-40fb-a20f-af95781bd4ee","resolution":{"observed_at":"2026-08-06T00:40:38.019213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.085286Z","title":"Paech, Paul Pak, Rom N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.085286Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:5bbca54bbff0f5b7876867dd3867fedb7c1b4abbc8a851d6d413d10fd9b29ae4","observation_id":"2f4195d7-0ee4-4257-8e6a-189714d90795","resolution":{"observed_at":"2026-08-06T00:40:38.085286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:46.226404Z","title":null,"venue":null,"work_id":"8016493c-ed53-4a9a-9df0-e2b7f3490ca4","year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.127831Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:bdc78338b6accd38e3037816daf72860fbc7bd186074549e30c96fa57d185d92","observation_id":"db4c5e0c-4960-416a-bdf6-e46d7d64c679","resolution":{"observed_at":"2026-08-06T00:40:46.326365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:46.009371Z","title":"Core ml tools.https://github.com/apple/coremltools","venue":null,"work_id":"c7da089f-6b72-431d-9828-7c42dd742cb9","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.186985Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:e1e7d97b995203c295f8c49fce3a0d50c2616d744a0aaf6bd82b1481ac613463","observation_id":"49eda807-5519-48ec-b724-b436b30dad8b","resolution":{"observed_at":"2026-08-06T00:40:46.128012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.269476Z","title":"Exaone 4.0: Unified large language models integrating non-reasoning and reasoning modes, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.269476Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:ddce8eeac62976dbf6a5a68993cad3dfc403062b4a5db23c839fbce1602ce24d","observation_id":"d932d690-ee40-467c-aa46-1414676f33bb","resolution":{"observed_at":"2026-08-06T00:40:38.269476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.333365Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.333365Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:6300101266b044e17f06af852214c52031c272b70540da79e0d3a3ad1d25c8e4","observation_id":"5ead73c5-7807-49a4-bcdb-d578962e5ea4","resolution":{"observed_at":"2026-08-06T00:40:38.333365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.412592Z","title":"Generating long sequences with sparse transformers,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.412592Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:cdd2919a97d461138e2779231b81a79c260e8bc3e0445b67d79f212dab3a54a2","observation_id":"f8727d1d-dc1d-470a-b2bc-7fd2a455bc4f","resolution":{"observed_at":"2026-08-06T00:40:38.412592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T00:40:38.533077Z","title":"Think you have solved question answering? try arc, the AI2 reasoning challenge.CoRR, abs/1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.533077Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:45d5ac786bc818fdbeeeddec4b4edbe3423ebc0f9edcf6021a93c0b2af39b40f","observation_id":"2bed0ca4-d95c-48d8-8461-6e7bd958fee2","resolution":{"observed_at":"2026-08-06T00:40:38.533077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-06T00:40:38.593589Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.593589Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:6278b763ea1cc6a947dbd9dbf917332b4333afb17af5db3c99306e077a9b508b","observation_id":"a61c791f-5969-4960-b805-85b045b497fd","resolution":{"observed_at":"2026-08-06T00:40:38.593589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05442","last_updated":"2023-02-10T18:58:21Z","snapshot_observed_at":"2026-08-09T22:02:34.443864Z","submitted_at":"2023-02-10T18:58:21Z","title":"Scaling Vision Transformers to 22 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05442","snapshot_observed_at":"2026-08-06T00:40:38.653520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.653520Z"},"links":{"cited_paper":"/paper/2302.05442","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:d4c56ea36f4ce9a2b7b018e95d4cf13713cbb9285833a7840328f88b6a1d6c4f","observation_id":"a09046c1-03fd-451d-91a8-f87589e196ff","resolution":{"observed_at":"2026-08-06T00:40:38.653520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08153","last_updated":"2020-05-07T03:30:49Z","snapshot_observed_at":"2026-08-10T19:01:35.604774Z","submitted_at":"2019-02-21T17:31:32Z","title":"Learned Step Size Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.08153","snapshot_observed_at":"2026-08-06T00:40:38.734813Z","title":"Esser, Jeffrey L","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.734813Z"},"links":{"cited_paper":"/paper/1902.08153","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:9141bfab106e363d18385d046b17a30b7a8eb0e5c7594f0f052a24799c6abb24","observation_id":"a211fb2b-3085-45b4-8bf1-583eef5a886f","resolution":{"observed_at":"2026-08-06T00:40:38.734813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-06T00:40:38.814115Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.814115Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:29c39de32138e8a0a0a489ecfbcf5d77769b7c4fc51e383167e65d3671fc9211","observation_id":"129b9143-8edd-44b0-9ab5-1b7282e9ab6c","resolution":{"observed_at":"2026-08-06T00:40:38.814115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.871473Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.871473Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:20cd2d11bb1369fc440ae603f63751229b91840cc07b7870c54b97d47c820eb8","observation_id":"f4e51269-2a07-46dd-8bab-2a1e0167b965","resolution":{"observed_at":"2026-08-06T00:40:38.871473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.933822Z","title":"How to train long-context language models (effectively), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.933822Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:7431c9419d3b7c35e97e42437b6db5a585804f9829ea2d5c8a8d31b6cdd4fab4","observation_id":"7eb2464a-6bf5-47b2-afee-1fa374100af3","resolution":{"observed_at":"2026-08-06T00:40:38.933822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:45.760429Z","title":"llama.cpp.https://github.com/ggml-org/llama.cpp, 2023","venue":null,"work_id":"dc9218d9-3fda-4226-b481-1b58698c2969","year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.994194Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:223440f71e0635d8f22c85e5f657293b0d8062780ed2db1db4fc54552020a07d","observation_id":"e693ea16-a732-4743-b279-04c151e82643","resolution":{"observed_at":"2026-08-06T00:40:45.865875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T00:40:39.040476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.040476Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:d7ac1dd195c7c6d1bdca198e2ce6a4742ea860035e12e1821f32f2ab5a45a098","observation_id":"1d5c526f-1a3f-480d-be16-aadcdf8079e1","resolution":{"observed_at":"2026-08-06T00:40:39.040476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T00:40:39.090330Z","title":"Measuring massive multitask language understanding.arXivpreprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.090330Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:55170183be2dbac1a16a01c0c8b1cb0f5b07da9fa40857935819d57ab549da46","observation_id":"61e50499-6a48-40b6-9bca-536dacbd0b57","resolution":{"observed_at":"2026-08-06T00:40:39.090330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T00:40:39.170029Z","title":"Distilling the knowledge in a neural network, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.170029Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:0b68ddae51285d30a9ab8284750aeabbc7dfddf16b15c72813abdb8c117b11af","observation_id":"e29d8689-ee60-4871-a7df-4f6d9cbe0f64","resolution":{"observed_at":"2026-08-06T00:40:39.170029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:45.495465Z","title":"nanotron.https://github.com/huggingface/nanotron, 2024","venue":null,"work_id":"41cefb70-a5ff-4cce-960f-96151f6ca66f","year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.223713Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:63a1f329bf6191b3255ae6dd749cb91cda4c77a2f34ac12bc80def17f7a82bae","observation_id":"8baf06ec-6f06-4843-a1ec-a116e16e44c4","resolution":{"observed_at":"2026-08-06T00:40:45.599027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:45.267828Z","title":"Quantization and training of neural networks for efficient integer-arithmetic-only inference,","venue":null,"work_id":"a0e8cb77-b4ba-435f-8fb8-19947a74ea0a","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.315215Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:9dfb7a031ef9427ae05998a4b29a49bcde5f50533c1b9d91c0461fd0c974b1c4","observation_id":"61c835e7-493a-4a0c-ade6-381417594b78","resolution":{"observed_at":"2026-08-06T00:40:45.358714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.04541","last_updated":"2022-04-09T20:13:51Z","snapshot_observed_at":"2026-08-09T00:23:25.750384Z","submitted_at":"2022-04-09T20:13:51Z","title":"KOBEST: Korean Balanced Evaluation of Significant Tasks","version":1},"cited_work":{"arxiv_id":"2204.04541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.04541","snapshot_observed_at":"2026-08-06T00:40:43.052000Z","title":"KOBEST: Korean Balanced Evaluation of Significant Tasks","venue":"cs.CL","work_id":"1bdbd3e4-d26f-4441-8802-0cc5e2cbf854","year":2022},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.472885Z"},"links":{"cited_paper":"/paper/2204.04541","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:a48812396c39f3a22890fa6a2469717f6f06a13a510f83279eb391955ea059b3","observation_id":"1567ab7a-6066-40fa-88d8-ec1db6f1d13e","resolution":{"observed_at":"2026-08-06T00:40:43.165120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06412","last_updated":"2024-07-04T13:08:19Z","snapshot_observed_at":"2026-08-04T04:40:39.327049Z","submitted_at":"2024-03-11T03:54:33Z","title":"CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06412","snapshot_observed_at":"2026-08-06T00:40:39.536784Z","title":"Click: A benchmark dataset of cultural and linguistic intelligence in korean, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.536784Z"},"links":{"cited_paper":"/paper/2403.06412","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:b470d2d96ac11fd4b6ff4a569d55ad690fa11baf7023d1e269e26270aad0db45","observation_id":"12760d5d-05da-4aa5-b0f3-5656c2a52b22","resolution":{"observed_at":"2026-08-06T00:40:39.536784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09426","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:42.803517Z","title":"Kormo: Korean open reasoning model for everyone, 2025","venue":null,"work_id":"2207dee3-6536-4c6c-b82c-b716eee074a2","year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.566528Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:7409f306cd4e046b4c6a80cde3a45f35e4a26fbda5f2ef8f5a1aacaee336dadb","observation_id":"2ae952a5-60a9-4096-a321-d261c3191a48","resolution":{"observed_at":"2026-08-06T00:40:42.895111Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-06T00:40:39.569435Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.569435Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:f41830a1a6b868d94b8ac5f313255873ff7e8f65110db71c551d09717d503c66","observation_id":"495fe7a6-70ef-4dee-8735-841557feabad","resolution":{"observed_at":"2026-08-06T00:40:39.569435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:45.097690Z","title":"Awq: Activation-aware weight quantization for llm compression and acceleration,","venue":null,"work_id":"19793305-d30a-475a-9877-c0c832912ecd","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.613669Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:c9326f758c9f34239bfcd41a7f05e5c79c9030dc2e15a78fe7d25d26480c53d8","observation_id":"86c9e491-ef4a-4fab-b37f-7eafb40bfd39","resolution":{"observed_at":"2026-08-06T00:40:45.194412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T00:40:39.734993Z","title":"Decoupled weight decay regularization.arXiv preprintarXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.734993Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:022825fecd199b4a70036df1b47b5eb666c2aa3f8f309e560602cf0a4f0ee0a4","observation_id":"34715b5d-ba39-4436-b4ec-e25a392bf696","resolution":{"observed_at":"2026-08-06T00:40:39.734993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:44.875470Z","title":"NVIDIAH200tensorcoreGPU,2024","venue":null,"work_id":"79c747eb-4123-41b8-89f7-83f6a41c5029","year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.819877Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:282048ae2b6e86593986136326ad65c8dc3a389754d9e96ba3e39aaa20284e0b","observation_id":"9f2d2f49-4d09-4560-913a-ab135588f2b1","resolution":{"observed_at":"2026-08-06T00:40:44.980104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:44.548747Z","title":"Nemotron-h: A family of accurate and efficient hybrid mamba-transformer models,","venue":null,"work_id":"6bdddd7f-5abd-4df1-b644-7bbc6c804ac8","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.933198Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:722a4fe44538fa42d035711901e8dab04c144993c11bd29675c3ef45e4a485b5","observation_id":"5c85173f-959b-4ccc-a867-c8bc83030d6c","resolution":{"observed_at":"2026-08-06T00:40:44.716747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:44.319450Z","title":"Qualcomm ai engine direct","venue":null,"work_id":"d71b5457-eba1-428a-80df-26194c69d4f1","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.118096Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:8437fe5bf57996c1e6f00d4486b04546f81208ee4dc325acd8ce098129701b17","observation_id":"1386fefd-747f-42c1-9bf9-59b583fa4382","resolution":{"observed_at":"2026-08-06T00:40:44.423595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T00:40:40.190491Z","title":"GPQA: A graduate-level google-proof q&a benchmark.arXivpreprintarXiv:2311.12022, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.190491Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:c24a62cdb28c8dc9bd41b8ab1642ca070be9e31da81abb5c5e559b6c498a4e5a","observation_id":"5f706c30-b203-4736-85c8-4164f6cb7872","resolution":{"observed_at":"2026-08-06T00:40:40.190491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-06T00:40:40.245964Z","title":"Winogrande: An adversarial winograd schema challenge at scale, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.245964Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:0a82c365afc5912402d03420207393f2ead43ebed5d4d145be5422aee0ec867d","observation_id":"b1c2bde4-749b-4fae-8574-9659f9edce52","resolution":{"observed_at":"2026-08-06T00:40:40.245964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:44.157789Z","title":"Neural machine translation of rare words with subword units,","venue":null,"work_id":"3aa9114d-ed5f-4dd1-9230-3e4875dc4079","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.389754Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:af668e4d93dc505c8fd8a5af3068f36c5dd578c9984b7a64cf5a789671497880","observation_id":"9603918e-329c-487f-a07c-b96d1d0e9aa2","resolution":{"observed_at":"2026-08-06T00:40:44.202901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-06T00:40:40.599281Z","title":"Glu variants improve transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.599281Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:1e76a4f02b799f1112432faa8bfcf3156ce6e259b72468f1ebcbcddacf8b23f1","observation_id":"d4c912bb-1b28-4f33-bbc6-9feccd4befd3","resolution":{"observed_at":"2026-08-06T00:40:40.599281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:43.949441Z","title":"Kmmlu: Measuring massive multitask language understanding in korean,","venue":null,"work_id":"cb4d78f8-9982-44ea-b7eb-06dbe12bf83f","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.768124Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:69ecba2e59bbc2175d0e46e8c3185c7f42affd2618166de173eaa9fb3421c229","observation_id":"9756f803-6b06-46fc-81c6-97b62929fa36","resolution":{"observed_at":"2026-08-06T00:40:44.090483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02706","last_updated":"2024-03-20T16:56:48Z","snapshot_observed_at":"2026-08-10T14:42:47.848135Z","submitted_at":"2023-09-06T04:38:16Z","title":"HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02706","snapshot_observed_at":"2026-08-06T00:40:41.046534Z","title":"Hae-rae bench: Evaluation of korean knowledge in language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.046534Z"},"links":{"cited_paper":"/paper/2309.02706","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:b354de3f1d321fb2dfb4ae73287ed8c6e153f583105592dc927472db0e1b47d5","observation_id":"f4ce0ec8-1431-40e9-8312-6fd4ff5b33e0","resolution":{"observed_at":"2026-08-06T00:40:41.046534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:43.678247Z","title":"Stm neural network deployment framework.https://stm32ai.st.com/stm32-cube-ai/","venue":null,"work_id":"03db07ed-9137-4a29-be66-9d8f67beb436","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.149824Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:25bf0511003224f8824f67c24275aff0c9956e9b6378ff54aad49f5872df9583","observation_id":"36e3fe84-11fc-4c0f-934e-08e856b343d8","resolution":{"observed_at":"2026-08-06T00:40:43.825657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-06T00:40:41.270369Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.270369Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:343a821ad4e91a4ab010ff0f31463c982f5c539fb2e80b788c4980cfe5642f04","observation_id":"a1b1f3c2-124b-4e57-b821-d5c4e3e33ed7","resolution":{"observed_at":"2026-08-06T00:40:41.270369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T00:40:41.373707Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.373707Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:4d5a7c2e9b0e7582598c72eba4f6c69e626588738cb73f947eef636be4bfd8fe","observation_id":"648a2b45-44fa-4ffd-b692-b708e2fcf041","resolution":{"observed_at":"2026-08-06T00:40:41.373707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-06T00:40:41.501338Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.501338Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:02df11f8f27690854d3f33052d30eadcc70c25d0577c8630fa52d9bc127729c6","observation_id":"d9e68187-39e5-4773-9534-c587381be35c","resolution":{"observed_at":"2026-08-06T00:40:41.501338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-06T00:40:41.641972Z","title":"An empirical study of mamba-based language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.641972Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:f9b20118beca1e30ed0ef6a922fa4f7c4e723735a885c575f98a65666e241740","observation_id":"cd9c3415-c91d-4683-9c51-2e8a379a6f25","resolution":{"observed_at":"2026-08-06T00:40:41.641972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T00:40:41.747432Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.CoRR, abs/2406.01574,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.747432Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:32ffc96148502654c04c85abe8f25919c854b9a0eaa924955ca62fc94eebeb76","observation_id":"138c3787-3c23-4729-90aa-28fde24182bd","resolution":{"observed_at":"2026-08-06T00:40:41.747432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T00:40:42.089130Z","title":"Huggingface’s transformers: State-of-the-art natural language processing, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:42.089130Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:728011041f8cd72593f9f232c1acf9a5efe46fe862a855a2e2c61e7f83964c1a","observation_id":"f66a204f-be3f-4973-bdda-e35a0c85edd1","resolution":{"observed_at":"2026-08-06T00:40:42.089130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T00:40:42.201123Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:42.201123Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:635d5951acc6f629d4ac630928c9bc293b1e62f5e48ec198b07f4d83785b02d8","observation_id":"a9b2fff2-02c7-4949-a467-b000fc3062e1","resolution":{"observed_at":"2026-08-06T00:40:42.201123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-06T00:40:42.308311Z","title":"Gated delta networks: Improving mamba2 with delta rule, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:42.308311Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:cbff3a10a12e6f5287caa29fc87f65a6ee5027fba15b3b22ec9f8f9ccfe1e57d","observation_id":"1fe68431-eed4-4653-a4eb-de2f2def4143","resolution":{"observed_at":"2026-08-06T00:40:42.308311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:42.454078Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:42.454078Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:e2e6d294be30ed8c3cbe4f26b75f9c894ebd17c4bace5154109a20cf8824720a","observation_id":"9f30c5f3-1fb6-4472-8126-e7ce292b71fe","resolution":{"observed_at":"2026-08-06T00:40:42.454078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T00:40:41.883305Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.883305Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:394d255b5a46c12076ac93d99258e52fe64f851d61d5a6e7fbad07d064f5f1b7","observation_id":"42c24c00-48e1-4682-bad4-2674cfa00e19","resolution":{"observed_at":"2026-08-06T00:40:41.883305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-06T00:40:40.497194Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.497194Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:8e6f1f5f3afc3e37ec9f3bfb984f904dd9753b8a3382d85be27eeae84f27b2a2","observation_id":"13fc859e-fde7-47dd-81a0-4a48dada7752","resolution":{"observed_at":"2026-08-06T00:40:40.497194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05877","last_updated":"2017-12-15T23:56:52Z","snapshot_observed_at":"2026-07-06T06:14:38.280461Z","submitted_at":"2017-12-15T23:56:52Z","title":"Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05877","snapshot_observed_at":"2026-08-06T00:40:39.362349Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.362349Z"},"links":{"cited_paper":"/paper/1712.05877","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:2b9c424f604363955f62b76fe3acb54a627864ff96cb917f7c02859b306093cb","observation_id":"54ba9700-648a-42ac-88ad-dce3c3af0f3c","resolution":{"observed_at":"2026-08-06T00:40:39.362349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-06T00:40:38.452513Z","title":null,"venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.452513Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:618fbdef0ed97e5c443fcc264856d65ddb8d4bfb1648ef3305532c585e80e449","observation_id":"10e8a21b-340b-46c6-8e92-b619f0f359e6","resolution":{"observed_at":"2026-08-06T00:40:38.452513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11548","last_updated":"2024-06-06T12:23:58Z","snapshot_observed_at":"2026-08-06T05:59:58.625725Z","submitted_at":"2024-02-18T11:41:07Z","title":"KMMLU: Measuring Massive Multitask Language Understanding in Korean","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11548","snapshot_observed_at":"2026-08-06T00:40:40.947491Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.947491Z"},"links":{"cited_paper":"/paper/2402.11548","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:4c3f3b6cbaada3c63ea4774e5869038aca5c0994c289b4d3dd1802883224f17d","observation_id":"effd9e86-44ed-4cbc-9d56-4231edeef1c1","resolution":{"observed_at":"2026-08-06T00:40:40.947491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-09T11:20:42.068658Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-06T00:40:40.028368Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.028368Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:637fac81eaa1c9573b46c93fe8c3a80d0874c1aae09eb82b6c11553816fcb2d0","observation_id":"080a09ab-e8a6-47a6-86e6-0ccf7b646661","resolution":{"observed_at":"2026-08-06T00:40:40.028368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-06T00:40:39.648672Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.648672Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:f4b2f329416a7c58602bc12da3fa3507bbc248edabd80819593fd7a41f4c1437","observation_id":"3e006c11-1cc5-4c73-9543-407fb53a993a","resolution":{"observed_at":"2026-08-06T00:40:39.648672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T07:53:12.692148Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.01034."}