{"as_of":"2026-08-10T07:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa58179df5b1f970f4a68ffe76aed1c326ab792d80e6c1a969382e493e98f79b","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:45:35.882329Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12769/citation-record","integrity":"/paper/2507.12769/integrity","json":"/paper/2507.12769/citation-record.json","paper":"/paper/2507.12769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:33.489328Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:33.489328Z"},"links":{"citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:427235df8789a5221093c4d6824b13417ff8c3110eaf34317945ef32a3c3b927","observation_id":"a73a9e69-35f8-416f-9a22-7ba170a977c3","resolution":{"observed_at":"2026-08-06T16:45:33.489328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:33.556667Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:33.556667Z"},"links":{"citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:568969c0b9435ba8d9800ae6a352d7ce906b4f63e54ee00e4c69649ad947b113","observation_id":"5206c9d5-0e8c-47e5-b2e0-eacf6ce4e34e","resolution":{"observed_at":"2026-08-06T16:45:33.556667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08818","last_updated":"2024-11-17T00:41:01Z","snapshot_observed_at":"2026-08-03T11:13:52.159847Z","submitted_at":"2024-07-11T18:59:21Z","title":"MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08818","snapshot_observed_at":"2026-08-06T16:45:33.629105Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:33.629105Z"},"links":{"cited_paper":"/paper/2407.08818","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:a903c739d0bfaf082bd932f570c2a273d9b794fb23334a1c4e424fce9076150c","observation_id":"a6e835f4-a804-4501-a480-56ff5a8da5ef","resolution":{"observed_at":"2026-08-06T16:45:33.629105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T16:45:33.727213Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:33.727213Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:a8e307c5f63f9a471e3b8da8012145155211612e73eee6ba6382f22034c8cd9c","observation_id":"35c35756-d215-45bd-b73b-f19db2098081","resolution":{"observed_at":"2026-08-06T16:45:33.727213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-06T16:45:33.788248Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:33.788248Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:80c88e02514e33ab70f9d60d174c6804ade42f7132a4a609f317f4f6f53fd269","observation_id":"97250218-9342-4794-8978-a6acb24e5878","resolution":{"observed_at":"2026-08-06T16:45:33.788248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-06T16:45:33.831893Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:33.831893Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:499c25870460a97e0c2cfa3df047c09637083c6d4be535bbc4f169b5ff4db592","observation_id":"c0644904-4aa5-4f9e-a965-946ec8b6fe35","resolution":{"observed_at":"2026-08-06T16:45:33.831893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T16:45:33.876998Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:33.876998Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:48f34d0d8827fa4e83450983b9a9570caa0beec31cf6bb012be9cb0b06ecc465","observation_id":"5cbcd9f0-034d-421e-a1bb-999aad76db70","resolution":{"observed_at":"2026-08-06T16:45:33.876998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02657","last_updated":"2024-11-01T08:52:18Z","snapshot_observed_at":"2026-08-07T01:31:29.067888Z","submitted_at":"2024-06-04T17:45:26Z","title":"Block Transformer: Global-to-Local Language Modeling for Fast Inference","version":2},"cited_work":{"arxiv_id":"2406.02657","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02657","snapshot_observed_at":"2026-08-06T16:45:36.180678Z","title":"Block Transformer: Global-to-Local Language Modeling for Fast Inference","venue":"cs.CL","work_id":"a3281e76-8a50-4ebd-abb4-6710f7b05754","year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:33.956079Z"},"links":{"cited_paper":"/paper/2406.02657","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:de3c37d9bbdb2be1181560155b4955e717ef3fccd095df359605e85593f92ed3","observation_id":"0143da35-488f-444b-a887-2f0abce2e3fe","resolution":{"observed_at":"2026-08-06T16:45:36.275908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-07T20:59:29.819833Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-06T16:45:34.035954Z","title":"Abdi, Dongsheng Li, Chin-Yew Lin, Yuqing Yang, and Lili Qiu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.035954Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:ba3b4174bcb8797c3bc346cbe1d813d658a059649688172356e180965af7227b","observation_id":"df5ba07c-3d6d-494f-b1f5-228867137817","resolution":{"observed_at":"2026-08-06T16:45:34.035954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20771","last_updated":"2025-04-02T03:23:02Z","snapshot_observed_at":"2026-07-06T19:40:34.668379Z","submitted_at":"2024-10-28T06:14:12Z","title":"MrT5: Dynamic Token Merging for Efficient Byte-level Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20771","snapshot_observed_at":"2026-08-06T16:45:34.114874Z","title":"Manning, Christopher Potts, and Róbert Csordás","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.114874Z"},"links":{"cited_paper":"/paper/2410.20771","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:714634847c806a5c13d9ed64b293bdda22472eb02931354c27a0bccd55c27e64","observation_id":"ad746d5b-2b45-4b54-82da-e7c4ccfb0193","resolution":{"observed_at":"2026-08-06T16:45:34.114874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08821","last_updated":"2024-12-15T21:20:12Z","snapshot_observed_at":"2026-08-06T10:11:02.511531Z","submitted_at":"2024-12-11T23:36:20Z","title":"Large Concept Models: Language Modeling in a Sentence Representation Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08821","snapshot_observed_at":"2026-08-06T16:45:34.210199Z","title":"Costa-jussà, David Dale, Hady Elsahar, Kevin Heffernan, João Maria Janeiro, Tuan Tran, Christophe Ropers, Eduardo Sánchez, Robin San Roman, Alexandre Mourachko, and 2 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.210199Z"},"links":{"cited_paper":"/paper/2412.08821","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:dbf73302c7ca673e461f7228186c867f1a90375de43e3de45dd23f554c8e062a","observation_id":"b4f0c9b0-8d44-4c97-b85a-a1d2b5c86ee2","resolution":{"observed_at":"2026-08-06T16:45:34.210199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-07T09:13:28.333702Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-06T16:45:34.301255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.301255Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:f9d2d41abe93eed2ea0bf9179304c43096f7d05859abf7c2ca80517c3f52de5f","observation_id":"16152354-bab5-44ab-a8c0-94113539cf18","resolution":{"observed_at":"2026-08-06T16:45:34.301255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-06T16:45:34.398285Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.398285Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:b743c712b24a386edd18bff70f2d1ab6931dc0905aa8ac5c9572f951e9e4eb91","observation_id":"163cec58-7fcd-41df-a1d6-3939de400f21","resolution":{"observed_at":"2026-08-06T16:45:34.398285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:34.486771Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.486771Z"},"links":{"citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:b5ea989dabbcd28dee5719b4cf3315d5eea58fc1ef05f672d41513a16730fbc1","observation_id":"0c1f0560-80cf-47e6-92f2-3ac25ef99105","resolution":{"observed_at":"2026-08-06T16:45:34.486771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13711","last_updated":"2022-04-16T20:47:45Z","snapshot_observed_at":"2026-08-02T23:31:06.593557Z","submitted_at":"2021-10-26T14:00:49Z","title":"Hierarchical Transformers Are More Efficient Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13711","snapshot_observed_at":"2026-08-06T16:45:34.588473Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.588473Z"},"links":{"cited_paper":"/paper/2110.13711","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:9f6e85b40a74ef60b18a3a79bfcfe03a2eb63acab996d2735ffbacf728b0c747","observation_id":"6c4fde03-02e7-4b3e-a922-e05952aca607","resolution":{"observed_at":"2026-08-06T16:45:34.588473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09871","last_updated":"2024-12-13T05:33:32Z","snapshot_observed_at":"2026-08-08T23:31:28.628409Z","submitted_at":"2024-12-13T05:33:32Z","title":"Byte Latent Transformer: Patches Scale Better Than Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09871","snapshot_observed_at":"2026-08-06T16:45:34.701858Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.701858Z"},"links":{"cited_paper":"/paper/2412.09871","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:9a44e6be78cc2be7d1da7ab652a250b44255e8d08ef526e5b4aa95e98f98afaa","observation_id":"b6c96cd5-26b4-46c5-a8f7-55e1c4d53548","resolution":{"observed_at":"2026-08-06T16:45:34.701858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-06T16:45:34.787104Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.787104Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:e6d36e7256fd779aa4a2fde19741b869cf69551aac80496aad431cfd4a8602c0","observation_id":"cbcf2ab9-5564-4d60-829d-bfeb09ff547c","resolution":{"observed_at":"2026-08-06T16:45:34.787104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05892","last_updated":"2024-09-26T22:39:08Z","snapshot_observed_at":"2026-08-06T19:53:21.536135Z","submitted_at":"2024-04-08T22:20:59Z","title":"Eagle and Finch: RWKV with Matrix-Valued States and Dynamic Recurrence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05892","snapshot_observed_at":"2026-08-06T16:45:34.859687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.859687Z"},"links":{"cited_paper":"/paper/2404.05892","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:18fa82ebd81e589fb5f8c2a0ffb7632f06020d25392b697f1a049e7f4702815b","observation_id":"3b71ccfb-03c1-40b1-bef8-158f7bde71be","resolution":{"observed_at":"2026-08-06T16:45:34.859687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-06T16:45:34.960190Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:34.960190Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:9102998d279a0c97d9699ae0d3e0d8c617811cb168ddae8ba00dec104c2d6cdd","observation_id":"4da19791-b547-4688-9bbd-a6e0e19f4904","resolution":{"observed_at":"2026-08-06T16:45:34.960190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-06T16:45:35.018992Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.018992Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:c8a81242880da821c3a4a9c3a74f3265bfcff425baeba194c93dcf13b0a942d9","observation_id":"5034254f-a52f-436d-916e-fd432a6c206f","resolution":{"observed_at":"2026-08-06T16:45:35.018992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-06T16:45:35.078091Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.078091Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:adee2172d33c2dbe53e8199162790afa80f834b43cf92a99ae3a9879d77707d5","observation_id":"2c5bb5ab-f07b-40b5-9d89-2260855c0fd1","resolution":{"observed_at":"2026-08-06T16:45:35.078091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-06T16:45:35.130477Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.130477Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:3c60f21dcac0039f275dc661fcac0630ee2bc65f179c42874fa64df2c8a813b8","observation_id":"cbc1faf9-7c8a-4309-b5cf-d71ec22da923","resolution":{"observed_at":"2026-08-06T16:45:35.130477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-06T16:45:35.200985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.200985Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:cb057187cbe560698f2903cac19406e0d2229a2278080e93ec28ea81d6b06884","observation_id":"62eb9815-aeae-49c6-bd35-ee650d64bc52","resolution":{"observed_at":"2026-08-06T16:45:35.200985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13660","last_updated":"2024-08-09T20:18:57Z","snapshot_observed_at":"2026-07-06T17:20:03.996763Z","submitted_at":"2024-01-24T18:53:53Z","title":"MambaByte: Token-free Selective State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13660","snapshot_observed_at":"2026-08-06T16:45:35.271646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.271646Z"},"links":{"cited_paper":"/paper/2401.13660","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:6fa84d15ef8c0359a0309f6ce277a4d60dc3aa11916087c83f56fa47b0bf772d","observation_id":"97e3d855-f6fa-4e91-ba13-2dec5e67755c","resolution":{"observed_at":"2026-08-06T16:45:35.271646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-06T16:45:35.352418Z","title":"Li, Madian Khabsa, Han Fang, and Hao Ma","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.352418Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:790bb3d4470a053b5ed145257c1bd6c0cd91a7cb9bf96b9353b213ed65a3822e","observation_id":"7c57c5eb-7673-432a-a778-07eed5403a9d","resolution":{"observed_at":"2026-08-06T16:45:35.352418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-06T16:45:35.424748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.424748Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:24b3caa67967888ebd719ac9ffede1b61ffe96c499c5e82bd0a3d95de1b8be69","observation_id":"3ce9473c-8423-45c1-824a-e59bf58d3e87","resolution":{"observed_at":"2026-08-06T16:45:35.424748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:45:35.486367Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.486367Z"},"links":{"citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:1d88550e6564135502fc4fb94f804ede6217f427c2e25b921ee74976c7417776","observation_id":"30a2b1c2-70bb-4c5f-8a10-9ffeecd0a5f2","resolution":{"observed_at":"2026-08-06T16:45:35.486367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07185","last_updated":"2023-05-19T21:09:11Z","snapshot_observed_at":"2026-08-03T05:17:47.917141Z","submitted_at":"2023-05-12T00:55:41Z","title":"MEGABYTE: Predicting Million-byte Sequences with Multiscale Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07185","snapshot_observed_at":"2026-08-06T16:45:35.749317Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.749317Z"},"links":{"cited_paper":"/paper/2305.07185","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:150d450cf7ba093cece645f10ad19ed3ec37676f62e697349e6bd88273e8dc3b","observation_id":"fe5946b5-a58e-4d93-8cc2-6d28d41dd271","resolution":{"observed_at":"2026-08-06T16:45:35.749317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-07T14:17:15.942844Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-06T16:45:35.805318Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.805318Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:e8c5e8f654f5f7b6d4b7e092cc90a322a147d5de6b1c7f077e871bc3864a27cf","observation_id":"89388682-9a1c-4fb2-916d-88bce4a0cd79","resolution":{"observed_at":"2026-08-06T16:45:35.805318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-06T16:45:35.882329Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T16:45:35.882329Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2507.12769"},"observation_digest":"sha256:bd27d786fca08c7bcd547c1477969ff4a8f8700288fb12f909e0725e9d7541d6","observation_id":"600423c6-81aa-479f-be0b-42a0a09390ad","resolution":{"observed_at":"2026-08-06T16:45:35.882329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12769","last_updated":"2025-07-17T04:01:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T10:26:12.627976Z","submitted_at":"2025-07-17T04:01:28Z","title":"Synergy: End-to-end Concept Model"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2507.12769."}