{"as_of":"2026-08-16T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1090b0df26ac55d858212e19af699adf3e7c4ae4d415ec1349c82ef627cd1b72","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:40:11.880130Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:03:42.481591Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T01:09:19.454543Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-08-11T12:03:42.481591Z","title":"Ultra-sparse memory network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14711","last_updated":"2025-02-27T16:33:09Z","snapshot_observed_at":"2026-08-14T22:43:45.227916Z","submitted_at":"2024-12-19T10:21:20Z","title":"ReMoE: Fully Differentiable Mixture-of-Experts with ReLU Routing","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T12:03:42.481591Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2412.14711"},"observation_digest":"sha256:be961cd9782f0ea1a393bd2d9498697b893c1f2ef300d13a296b62a72d518efb","observation_id":"2b074278-78de-4f66-a8ea-d8d8537c3e3c","resolution":{"observed_at":"2026-08-11T12:03:42.481591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-08-07T13:43:20.892077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21191","last_updated":"2025-05-27T13:40:28Z","snapshot_observed_at":"2026-08-14T10:12:10.764232Z","submitted_at":"2025-05-27T13:40:28Z","title":"Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:43:20.892077Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2505.21191"},"observation_digest":"sha256:a8f24b0dca224e705af720f7d9b14d933326624f34fc5aa7fe84a48bfee17e7b","observation_id":"ab689d32-1985-4586-bc5b-1776e1733e0c","resolution":{"observed_at":"2026-08-07T13:43:20.892077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-08-05T16:17:41.998354Z","title":"Ultra-sparse memory network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-09T07:25:17.981291Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.998354Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:52032437cef4b8e262ed4893f138f84186fcf8e69ad1381236179b2704440169","observation_id":"e8ecbb92-aa3c-432f-9a7c-a9f8c04ef171","resolution":{"observed_at":"2026-08-05T16:17:41.998354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":"2411.12364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-07-04T01:09:19.454543Z","title":"Ultra-sparse memory network","venue":null,"work_id":"49f161a5-a12c-426e-9951-672389dcc100","year":2024},"citing_paper":{"arxiv_id":"2512.13751","last_updated":"2026-05-09T08:34:38Z","snapshot_observed_at":"2026-08-11T20:36:34.223497Z","submitted_at":"2025-12-15T05:50:45Z","title":"MIDUS: Memory-Infused Depth Up-Scaling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T22:02:42.297041Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2512.13751"},"observation_digest":"sha256:33d9ef794550464c0b1139da95b9f56aaf14651ac61dc805e39fd3d0d1287285","observation_id":"9a4381f8-292a-496d-8f4e-52436d4de2cd","resolution":{"observed_at":"2026-05-16T22:03:36.155671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":"2411.12364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-07-04T01:09:19.454543Z","title":"Ultra-sparse memory network","venue":null,"work_id":"49f161a5-a12c-426e-9951-672389dcc100","year":2024},"citing_paper":{"arxiv_id":"2605.20948","last_updated":"2026-05-20T09:35:04Z","snapshot_observed_at":"2026-08-14T03:42:20.388820Z","submitted_at":"2026-05-20T09:35:04Z","title":"Memory Grafting: Scaling Language Model Pre-training via Offline Conditional Memory","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T05:49:14.789955Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2605.20948"},"observation_digest":"sha256:be790a9a737fa5753b768a9e4eaef89574ca5111f4f8439e0d23d0d007d24469","observation_id":"05776b31-66e4-4652-bfcc-c8b9859efb31","resolution":{"observed_at":"2026-05-21T05:49:40.770806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":"2411.12364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-07-04T01:09:19.454543Z","title":"Ultra-sparse memory network","venue":null,"work_id":"49f161a5-a12c-426e-9951-672389dcc100","year":2024},"citing_paper":{"arxiv_id":"2606.09888","last_updated":"2026-06-03T09:10:06Z","snapshot_observed_at":"2026-08-07T11:36:12.913175Z","submitted_at":"2026-06-03T09:10:06Z","title":"SinkRec: Mitigating Semantic State Sink in Long Sequence Recommendation with Memory-Conditioned Gated Delta Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T07:13:54.031036Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2606.09888"},"observation_digest":"sha256:436d72df0c05fceec4decff7b72a02caa13b39b3c988f50aa32097dfc87b3da3","observation_id":"4b42034b-fa73-4903-833d-76720aa0da34","resolution":{"observed_at":"2026-07-02T07:06:43.815473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":"2411.12364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-07-04T01:09:19.454543Z","title":"Ultra-sparse memory network","venue":null,"work_id":"49f161a5-a12c-426e-9951-672389dcc100","year":2024},"citing_paper":{"arxiv_id":"2606.12113","last_updated":"2026-06-10T14:07:18Z","snapshot_observed_at":"2026-08-14T16:19:45.335100Z","submitted_at":"2026-06-10T14:07:18Z","title":"Augmenting Molecular Language Models with Local $n$-gram Memory","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T09:57:12.398344Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2606.12113"},"observation_digest":"sha256:dea2cb85bca47623bd7af77947d242b9486cc1be753bc9bc1e30f9d98c50736c","observation_id":"07965896-2fa1-4712-ae28-18f94b5ae216","resolution":{"observed_at":"2026-07-03T10:37:56.681243Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":"2411.12364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-07-04T01:09:19.454543Z","title":"Ultra-sparse memory network","venue":null,"work_id":"49f161a5-a12c-426e-9951-672389dcc100","year":2024},"citing_paper":{"arxiv_id":"2606.19172","last_updated":"2026-06-17T15:15:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-17T15:15:19Z","title":"User as Engram: Internalizing Per-User Memory as Local Parametric Edits","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T20:37:01.382431Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2606.19172"},"observation_digest":"sha256:187f0d887419254e268120384ce248bcd6dda77109a9992b06af4c9fe80121d7","observation_id":"3ef7cfa3-82d5-4c3d-af11-1ef9450c970d","resolution":{"observed_at":"2026-07-04T01:09:19.455849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-07-11T10:45:46.618668Z","title":"Ultra- sparse memory network.arXiv preprint arXiv:2411.12364,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04969","last_updated":"2026-07-06T11:57:32Z","snapshot_observed_at":"2026-08-12T20:25:07.333121Z","submitted_at":"2026-07-06T11:57:32Z","title":"Train Smarter, Not Longer: Memorization-Guided Data Reuse for Efficient LLM Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T10:45:46.618668Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2607.04969"},"observation_digest":"sha256:941a4ccd0ef017f4ec3a720aa5a25631f2f715b24a6a96e31261c9740dc7b0b4","observation_id":"e364a06c-7f2d-4cab-aeaf-bc5df9d406ab","resolution":{"observed_at":"2026-07-11T10:45:46.618668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.12364/citation-record","integrity":"/paper/2411.12364/integrity","json":"/paper/2411.12364/citation-record.json","paper":"/paper/2411.12364"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.713352Z","title":"Singular value decomposition (svd) and generalized singular value decomposition","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.713352Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:0eb24244c99d66f0d9f04217c2ab71332c08d6ee8659f8b95039df836e141e3d","observation_id":"49dd7439-157b-4e5c-a064-76f8c89ed5ba","resolution":{"observed_at":"2026-08-12T17:40:11.713352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-12T17:40:11.718011Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.718011Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:273877c1f11e2a06c3ab7a496c91d8b6c481d98c4bad6099b4b37163293dc7ce","observation_id":"90d13969-5966-4fde-9ac7-57bc76824daa","resolution":{"observed_at":"2026-08-12T17:40:11.718011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-12T17:40:11.722221Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.722221Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:a2a0569ef0158f271b28ee2b431825581686c9b0cdb28a69b4393a2cecba81ea","observation_id":"168cae66-14e8-4f63-a909-ba55dd778b30","resolution":{"observed_at":"2026-08-12T17:40:11.722221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01376","last_updated":"2024-02-05T12:42:52Z","snapshot_observed_at":"2026-08-16T14:22:09.503066Z","submitted_at":"2024-02-02T13:00:38Z","title":"LoTR: Low Tensor Rank Weight Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01376","snapshot_observed_at":"2026-08-12T17:40:11.725991Z","title":"Lotr: Low tensor rank weight adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.725991Z"},"links":{"cited_paper":"/paper/2402.01376","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:5c6c80dd0ecb7ab8a3c13271c93178c96d5f82bcc438e8e6b7c5a7b6146a69f1","observation_id":"f6d40994-6891-41eb-9625-ab09f9c52583","resolution":{"observed_at":"2026-08-12T17:40:11.725991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-08-13T14:54:27.001192Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-12T17:40:11.730098Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.730098Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:36dc54a6adfc386784c3e0d3ebcf54d7f7f2c24fc8375a5fc7b9fd4b211745c6","observation_id":"e02b3f88-803a-4aff-b065-4a1b7452254c","resolution":{"observed_at":"2026-08-12T17:40:11.730098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T17:40:11.733772Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.733772Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:b3ab1e8e5a1ad27a64c22bf3d77bd0fa15bd43ad717631c27efefd4b66b2e6ff","observation_id":"f701ef5f-3caf-4fb8-b0bb-0dc73efae480","resolution":{"observed_at":"2026-08-12T17:40:11.733772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.738251Z","title":"On the representation collapse of sparse mixture of experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.738251Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:2d3ccb868a432db986030789047106b963c3f72ad597580705d3cfdeb260b58d","observation_id":"e50a5810-8fa1-4aa3-bb7f-1b75b55a83d0","resolution":{"observed_at":"2026-08-12T17:40:11.738251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-08-14T15:52:43.138964Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-12T17:40:11.741689Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.741689Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:e15ec35c9781cc91f9ac7ea9a016b718963e87bf1b6f2ee9df4fbb9a672eb54a","observation_id":"9225d8b9-6342-4e42-bf6d-afab1d4231aa","resolution":{"observed_at":"2026-08-12T17:40:11.741689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-12T17:40:11.745425Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.745425Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:473ce287811045204fcb6820e143d249e7ce47b91852d52639cb0b858e5517ae","observation_id":"dcba7540-6c9f-485d-a8ba-1bab9920f714","resolution":{"observed_at":"2026-08-12T17:40:11.745425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.749017Z","title":"Redpajama: An open source recipe to reproduce llama training dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.749017Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:df6e82c42b5312b2beda223eca6425ad5811f7a668ee584823d49cb24b7415d7","observation_id":"56d6fdc6-72b9-4807-9a98-95aa69ef0e86","resolution":{"observed_at":"2026-08-12T17:40:11.749017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10837","last_updated":"2023-11-21T13:58:00Z","snapshot_observed_at":"2026-08-16T14:51:35.318065Z","submitted_at":"2023-10-16T21:23:16Z","title":"Approximating Two-Layer Feedforward Networks for Efficient Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10837","snapshot_observed_at":"2026-08-12T17:40:11.752516Z","title":"Approximating two-layer feedforward networks for efficient transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.752516Z"},"links":{"cited_paper":"/paper/2310.10837","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:4c4bd4bf700dd2d39a47c3df0faecd741ddd00b7d9152f7564404a9c462c3278","observation_id":"c6f7d534-4cca-42e0-88f7-859593b37b3e","resolution":{"observed_at":"2026-08-12T17:40:11.752516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-12T17:40:11.756344Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.756344Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:1e303c93ca22a973e6b8a138ce611b7a828014f4dac45d4a6ffd5836b8d164b3","observation_id":"793ab649-2840-47a9-8a7f-57020a0cda5c","resolution":{"observed_at":"2026-08-12T17:40:11.756344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-08-14T17:09:11.503312Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-12T17:40:11.759746Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.759746Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:c5d8a1d2fb656f05a2576449b330bf9cccdc28ad62a860a87563cf83b2fde684","observation_id":"38f6861d-5427-4df1-8efd-9bfc4aa2b7e4","resolution":{"observed_at":"2026-08-12T17:40:11.759746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T17:40:11.763763Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.763763Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:0508c4be6abe2235c0c47c14fcefadb3bfb5a7cd64f498f96dcae3ad0cb04a7b","observation_id":"bb380a63-bb88-450b-bef9-61fcf15e1dc0","resolution":{"observed_at":"2026-08-12T17:40:11.763763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.767356Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.767356Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:555f863f49c413cf50229702888f63ef4fcfd8b49f57e9ba63a1575b40a55da1","observation_id":"837ad763-237e-40b5-86f9-b6359c37b3cc","resolution":{"observed_at":"2026-08-12T17:40:11.767356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-13T01:11:33.500647Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-12T17:40:11.770687Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.770687Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:e55fdf3f653769ff406f5a026f7eb282d27c21b4bad0a54972a6bcedd952e6cb","observation_id":"7cae23e5-68a7-4d02-8b71-e25c2c3a5bab","resolution":{"observed_at":"2026-08-12T17:40:11.770687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-08-16T13:36:57.002490Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-12T17:40:11.774516Z","title":"Mixture of a million experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.774516Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:90a65515ca6e3c67d86cbaf602ec095d62170756f138a0d85df05ab798c394e5","observation_id":"38ad07e4-8279-44d0-83b1-d549a73128b0","resolution":{"observed_at":"2026-08-12T17:40:11.774516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-12T17:40:11.778396Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.778396Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:40fa2366d89f2b7638757c6ee0c1dc3fd9a56166c22859c79ddecc5330d82b1c","observation_id":"01cad70a-52e7-4f86-b8b2-86e9405c7870","resolution":{"observed_at":"2026-08-12T17:40:11.778396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-12T17:40:11.782216Z","title":"Mobilenets: Efficient convolu-tional neural networks for mobile vision applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.782216Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:a58ae5d3c24f7aefe6218cc52aa037c83f16da77e4c769867cf35d5113f35a8e","observation_id":"0bbf8997-344a-4614-988d-05df52dec7fc","resolution":{"observed_at":"2026-08-12T17:40:11.782216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.785609Z","title":"Product quantization for nearest neighbor search","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.785609Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:85e9682e2f0252052f09613c5b44739aac1d82847d306897bb0b27234dffdb56","observation_id":"c98a8dd7-81f7-456d-b2a3-3491cabf162f","resolution":{"observed_at":"2026-08-12T17:40:11.785609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T17:40:11.788900Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.788900Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:40dacdd9990c4625122f857d6aeaf44c72ede9b044c771448db92e71e8346c65","observation_id":"cf2fe7cc-3dc0-41af-be00-b9f54fccc2b7","resolution":{"observed_at":"2026-08-12T17:40:11.788900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-13T08:58:47.096400Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-12T17:40:11.792408Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.792408Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:382d29365bf3882b6a2d62560bf2278af703ebe32a15733cdb6dcd45bba62a4e","observation_id":"f5b6a5c7-2924-4699-b298-f3874bedbd2a","resolution":{"observed_at":"2026-08-12T17:40:11.792408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03881","last_updated":"2020-10-08T10:19:50Z","snapshot_observed_at":"2026-08-16T19:14:59.635265Z","submitted_at":"2020-10-08T10:19:50Z","title":"Large Product Key Memory for Pretrained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03881","snapshot_observed_at":"2026-08-12T17:40:11.796041Z","title":"Large product key memory for pretrained language models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.796041Z"},"links":{"cited_paper":"/paper/2010.03881","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:331b237af7b309d52402fbdc7ac650c49fc32787e3e5d7bdad977898cb60b6ab","observation_id":"eef2b7ce-bc41-4ad5-b63d-54980cf762fe","resolution":{"observed_at":"2026-08-12T17:40:11.796041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-16T14:19:14.574797Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-12T17:40:11.799681Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.799681Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:92e6618923e87d4c2346aa0daf18b19ca73c4960ee8c7240dd4dc5a94a292c9e","observation_id":"55220a9d-b5c6-428f-b64d-973a86cb10ba","resolution":{"observed_at":"2026-08-12T17:40:11.799681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.803785Z","title":"Large memory layers with product keys","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.803785Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:bfb80ea8a8efec05a3ce568d8fc110282a074fbb168f077833967ae391aecd88","observation_id":"e15c0b11-7d9b-4a29-9f09-9ae6a723a9e6","resolution":{"observed_at":"2026-08-12T17:40:11.803785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-12T17:40:11.807604Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.807604Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:4af600549c1700f4902037d257ca317da0f23207286270a4bc254e0b2633546b","observation_id":"7b815b85-e9ab-4701-9624-96aa1d4dbaf3","resolution":{"observed_at":"2026-08-12T17:40:11.807604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.811038Z","title":"Low-rank tucker decomposition of large tensors using tensorsketch","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.811038Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:0e26de7784f9e05d71213974f6f57a867be4d11f8f6515938b93d963190dc2cf","observation_id":"c08f18c0-0d65-408f-a388-7880799ec553","resolution":{"observed_at":"2026-08-12T17:40:11.811038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.814523Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.814523Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:78cc0dc229d9e2f5d845f94537fe3a3641d478f109b2b18918663d9cf263d2e7","observation_id":"a522919e-9bde-4b9d-a226-9c561f661c50","resolution":{"observed_at":"2026-08-12T17:40:11.814523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.818131Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.818131Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:78e9522b6927e393d27ac9ad5bb5cf638fd84da70c9059e8afab664d8fb72ef3","observation_id":"ceec7ec9-9da3-4730-aa58-35fd6a9fada6","resolution":{"observed_at":"2026-08-12T17:40:11.818131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.821670Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.821670Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:7a93e02d32c859e99cb90741a7e07bea41517d0717ae25173fa72d9f1e97cc49","observation_id":"fe2f46d1-93fb-4e1b-a590-a890f30b35b8","resolution":{"observed_at":"2026-08-12T17:40:11.821670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.825104Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.825104Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:9919289f914a7a5fef6fb3d285b45e8391ce0c223a8bcbe5cf6c89628d0a5152","observation_id":"5098089c-cb9e-413e-9e15-15daad3e080b","resolution":{"observed_at":"2026-08-12T17:40:11.825104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-16T07:06:07.822225Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-12T17:40:11.828614Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.828614Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:e16896ecb262234a791179e5a621f320e84f627803dd04b23d0c6901b3a80fcd","observation_id":"a5b61079-0425-4b16-b1ea-b59d91fae9c9","resolution":{"observed_at":"2026-08-12T17:40:11.828614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.832312Z","title":"Hash layers for large sparse models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.832312Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:52dc31f466944a14820762b1654feaf4832edfa99cee6b871d99cd7a1efbc4b3","observation_id":"7991625d-3965-4cba-8660-45da45170c0b","resolution":{"observed_at":"2026-08-12T17:40:11.832312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.835946Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.835946Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:76be364f270b2c95b5106f9d413422c4e65df1ae815554215c850339b01f370d","observation_id":"417f0688-3ddf-4135-bc75-1ce52165397e","resolution":{"observed_at":"2026-08-12T17:40:11.835946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-13T18:41:35.355818Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-12T17:40:11.839323Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.839323Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:a74753eaa95e15a80a1710ab47602b4997cd786d957b71ab5d64610553311c83","observation_id":"3dda8bfd-b93f-4cd4-acdc-4f3e3cbdf1ec","resolution":{"observed_at":"2026-08-12T17:40:11.839323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-13T11:35:07.866136Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-12T17:40:11.843128Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.843128Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:79bffb6d5deb0a4827ba047c7d497581c916a3700d5a17c0e8f0eaf83366b16e","observation_id":"f6eeeeeb-0339-4fe8-915d-adba2ce6b7c8","resolution":{"observed_at":"2026-08-12T17:40:11.843128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06461","last_updated":"2023-02-13T15:41:20Z","snapshot_observed_at":"2026-08-16T15:55:42.409032Z","submitted_at":"2023-02-13T15:41:20Z","title":"A Study on ReLU and Softmax in Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06461","snapshot_observed_at":"2026-08-12T17:40:11.846944Z","title":"A study on relu and softmax in transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.846944Z"},"links":{"cited_paper":"/paper/2302.06461","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:ec51f50b9b925734265008406635f4371a7ddb15f3345921de7950f0227040d3","observation_id":"4178765d-a19c-4b53-a8a4-42790ac2b85a","resolution":{"observed_at":"2026-08-12T17:40:11.846944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-12T17:40:11.850766Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.850766Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:03ac225bb70dc7e329ca88e06684dffd85a9940179e978c5db655f8f608e5ec3","observation_id":"b268acff-ebab-4aa8-a23e-1dc64dfbd0e8","resolution":{"observed_at":"2026-08-12T17:40:11.850766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.854624Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.854624Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:b54fd2555ca8d2af5e1102dbb9c95837d4f9504801ebfc8ba41e3b3626a36a70","observation_id":"d8b17f34-6df3-4d25-96fd-30cbe79577db","resolution":{"observed_at":"2026-08-12T17:40:11.854624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-12T17:40:11.858088Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.858088Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:2185c7fcaa61ff4734fd3b382cff9ea74a7a43006e7334ba5248daf5c07f8da1","observation_id":"2798ba0c-1687-4752-802c-a3c2dcf5fba7","resolution":{"observed_at":"2026-08-12T17:40:11.858088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T17:40:11.862189Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.862189Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:c6ace4791386b56f5a170bb0921ea2e9b9db0ad5bbc1a659ed13a95743628e69","observation_id":"a8de3515-0ce9-4973-8b3e-a78c8e442842","resolution":{"observed_at":"2026-08-12T17:40:11.862189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.866101Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.866101Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:62349b5c21b8e4f46929a0ec93128eb121078ddcdec5d71b14886c2a6943b41e","observation_id":"d430c2f1-83cc-4949-a235-da421349aa98","resolution":{"observed_at":"2026-08-12T17:40:11.866101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-12T17:40:11.869601Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.869601Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:c1a0ddb7c8052af660a49a319145d18f1c2cf5f27f80daab9ec981ffbba601e4","observation_id":"1bd81ccb-27cc-4159-b932-60140161e6cb","resolution":{"observed_at":"2026-08-12T17:40:11.869601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-12T17:40:11.873164Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.873164Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:0c05c9014619857f94c859a472d050f20b401e01fe97721ebab2f62c34176271","observation_id":"f964a509-040d-4db2-8c1f-3416831f6264","resolution":{"observed_at":"2026-08-12T17:40:11.873164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.876728Z","title":"Mixture-of-experts with expert choice routing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.876728Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:92e33dde1a113f074c7c2ae305c16cb9812132ca6a381608c2021764b928a444","observation_id":"a166d638-22f7-4ea9-8a54-d8577b75451c","resolution":{"observed_at":"2026-08-12T17:40:11.876728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:40:11.880130Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T17:40:11.880130Z"},"links":{"citing_paper":"/paper/2411.12364"},"observation_digest":"sha256:f66b7f6b08b042b1376b407a9ca6efa927123efc44b7bdf60480482b01fe8999","observation_id":"57c341e5-e6ae-4d34-b417-20149107f429","resolution":{"observed_at":"2026-08-12T17:40:11.880130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T11:39:55.912595Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 9 inbound Pith citation observations for arXiv:2411.12364."}