{"as_of":"2026-08-21T16:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e340b370b47e40faa94055887c2249bb28f1da6d261610352bde94e8dc7b7dac","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:41:49.471089Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:50:21.977570Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:06:14.781833Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"cited_work":{"arxiv_id":"2505.00792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00792","snapshot_observed_at":"2026-07-01T21:06:14.781833Z","title":"arXiv preprint arXiv:2505.00792 (2025) 10 X","venue":null,"work_id":"06111ff0-17d6-4b59-b471-d3fe7d944f18","year":2025},"citing_paper":{"arxiv_id":"2604.07298","last_updated":"2026-04-08T17:04:45Z","snapshot_observed_at":"2026-08-14T02:31:17.564550Z","submitted_at":"2026-04-08T17:04:45Z","title":"Region-Graph Optimal Transport Routing for Mixture-of-Experts Whole-Slide Image Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:35.473995Z"},"links":{"cited_paper":"/paper/2505.00792","citing_paper":"/paper/2604.07298"},"observation_digest":"sha256:cc5a74de4de84e12c4d10a0052ed0c36790595b4d037f5156cd8e99db83ea780","observation_id":"fab87040-c301-4cc4-86bc-988da245064b","resolution":{"observed_at":"2026-05-11T00:45:49.824512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"cited_work":{"arxiv_id":"2505.00792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00792","snapshot_observed_at":"2026-07-01T21:06:14.781833Z","title":"arXiv preprint arXiv:2505.00792 (2025) 10 X","venue":null,"work_id":"06111ff0-17d6-4b59-b471-d3fe7d944f18","year":2025},"citing_paper":{"arxiv_id":"2606.01047","last_updated":"2026-05-31T06:35:10Z","snapshot_observed_at":"2026-08-19T01:56:26.154206Z","submitted_at":"2026-05-31T06:35:10Z","title":"Learning Multi-Modal Trajectory Policies for Data-Efficient Robotic Manipulation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T17:26:36.956666Z"},"links":{"cited_paper":"/paper/2505.00792","citing_paper":"/paper/2606.01047"},"observation_digest":"sha256:96a2bcd6a2ae979897a594a75551e8fd2ede53e78b4f3bba9a462734c3faf377","observation_id":"25f7e56a-d0e9-436f-953d-d05851d0457b","resolution":{"observed_at":"2026-07-01T21:06:14.784737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00792","snapshot_observed_at":"2026-08-03T00:50:21.977570Z","title":"arXiv preprint arXiv:2505.00792 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28670","last_updated":"2026-08-17T16:01:17Z","snapshot_observed_at":"2026-08-20T23:16:59.234387Z","submitted_at":"2026-07-25T12:43:47Z","title":"Hierarchical Copula-Gumbel-Top-K Routing: Two-Sided Dependence Control for Frozen Mixture-of-Experts at Fixed Per-Token Routing Laws","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T00:50:21.977570Z"},"links":{"cited_paper":"/paper/2505.00792","citing_paper":"/paper/2607.28670"},"observation_digest":"sha256:b6639e613621d5f73fc22cd67941f2841d4fbf23b72419f2a0de6593afc560c7","observation_id":"1c31456a-2839-4b42-93af-c031c34fedca","resolution":{"observed_at":"2026-08-03T00:50:21.977570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00792/citation-record","integrity":"/paper/2505.00792/integrity","json":"/paper/2505.00792/citation-record.json","paper":"/paper/2505.00792"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.10684","last_updated":"2022-10-26T16:14:05Z","snapshot_observed_at":"2026-08-17T06:02:42.650883Z","submitted_at":"2021-12-20T17:05:11Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10684","snapshot_observed_at":"2026-08-16T04:41:49.257916Z","title":"V., Du, J., Iyer, S., Pasunuru, R., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.257916Z"},"links":{"cited_paper":"/paper/2112.10684","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:cb3e491ca302f281a4022ff8b987a6bfbd5c53cfba9dab5b8b84b5f6d8e708cc","observation_id":"23d172a2-a757-4c5d-951d-be49201300e8","resolution":{"observed_at":"2026-08-16T04:41:49.257916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:50.076132Z","title":"L., Darrell, T., Malik, J., and Efros, A","venue":null,"work_id":"f9c2ae55-5389-4387-8149-3f159ecd2ac8","year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.263438Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:191f0f3b667c50c75622121b8fd7cdc28b44c69840748c389f1a360e91a0adcc","observation_id":"4ec484d0-40e4-4490-9309-99010407acee","resolution":{"observed_at":"2026-08-16T04:41:50.080485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-17T05:59:48.347864Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-16T04:41:49.267497Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.267497Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:76fb53411c20739b8ffb53c6d9c5e9e90451d5a7f3c9d72708e58146c8ab70fe","observation_id":"edfdad44-7cd8-4657-b019-ed497e1656ab","resolution":{"observed_at":"2026-08-16T04:41:49.267497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.272533Z","title":"K., Aggarwal, K., Som, S., Piao, S., and Wei, F","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.272533Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:1cb8f2cf151a2975c96e90fe41a1f103d48a1daa7fa5e23197794ae943069ef8","observation_id":"dc96d33c-48fc-4d01-993b-51d7ef7dc488","resolution":{"observed_at":"2026-08-16T04:41:49.272533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06297","last_updated":"2016-01-07T22:41:10Z","snapshot_observed_at":"2026-08-14T22:22:10.782232Z","submitted_at":"2015-11-19T18:40:22Z","title":"Conditional Computation in Neural Networks for faster models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06297","snapshot_observed_at":"2026-08-16T04:41:49.276815Z","title":"Conditional computation in neural networks for faster models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.276815Z"},"links":{"cited_paper":"/paper/1511.06297","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:8d88779765bd58c63fcbcb3019193fd40e982354981af732b47ac589fa0acbfc","observation_id":"bf2f5b67-05f2-4084-bb11-55b6d07bd398","resolution":{"observed_at":"2026-08-16T04:41:49.276815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:50.053516Z","title":"and Svensén, M","venue":null,"work_id":"eabcb462-5f4a-4652-9dd9-a408f09931cf","year":2003},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.281587Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:f8e7e3a731040d68b54d8a1c22634b7697d4fd5ea29404597ff073c5975885ed","observation_id":"1c20dbd1-8982-499f-ab47-dc4f5af57601","resolution":{"observed_at":"2026-08-16T04:41:50.057706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T04:41:49.286518Z","title":"B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.286518Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:826b95a14a8a9421c9e4da88f179ea405e88c2266bf944a522d70871c3ccf1f2","observation_id":"513cda42-5693-4cda-aa77-f04ea65c7034","resolution":{"observed_at":"2026-08-16T04:41:49.286518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04807","last_updated":"2020-03-10T15:33:54Z","snapshot_observed_at":"2026-08-17T23:59:15.683084Z","submitted_at":"2020-03-10T15:33:54Z","title":"Efficient Intent Detection with Dual Sentence Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04807","snapshot_observed_at":"2026-08-16T04:41:49.290923Z","title":"Efficient intent detection with dual sentence encoders","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.290923Z"},"links":{"cited_paper":"/paper/2003.04807","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:5ae4481f2dbd2e64857445c0a630cdf0c2394eb5e9ce44d4f760454cd262c9a4","observation_id":"81f4cbb9-bb2a-4e83-a54a-e6a156ac5a4a","resolution":{"observed_at":"2026-08-16T04:41:49.290923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:50.040248Z","title":"K., Liu, S., and Wang, Z","venue":null,"work_id":"551a002a-900f-40b0-b76b-2456ca4e0ab3","year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.295286Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:e5e49c2c833035c025de367648db3f9103c434b05edc73ef178eedda13fb791a","observation_id":"1d7d7e27-ba42-4690-bc98-9cf1bff41510","resolution":{"observed_at":"2026-08-16T04:41:50.044343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:50.026542Z","title":"On the representation collapse of sparse mixture of experts","venue":null,"work_id":"912dd9c1-0b2d-49ee-9689-b40de2d1b075","year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.299426Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:1c917dc8bf982becd317a05a0c9b74fb1b5c49fa70c4b1361d075ff390173bc6","observation_id":"9fbbd6cc-d7db-4005-b80e-8469937dbcc3","resolution":{"observed_at":"2026-08-16T04:41:50.030597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.49","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.529151Z","title":"Approximating two-layer feedforward networks for efficient transformers","venue":null,"work_id":"99850c4b-a7b3-4d47-94f6-41784cc6eaff","year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.303411Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:1873af8bbfa702b48cbe1f5b21c0197c5b430178763b9a8e3878d057c2be0038","observation_id":"5ef516f5-345d-48ec-bc22-71510977fad6","resolution":{"observed_at":"2026-08-16T04:41:49.535519Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.307818Z","title":"Stablemoe: Stable routing strategy for mixture of experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.307818Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:18825ada67b3314b99359120d9a6d2f3b3ddf9c2c1079bf2b74376707ee6ea2b","observation_id":"1564732f-ff9a-4194-b3ef-d3667dfa79cd","resolution":{"observed_at":"2026-08-16T04:41:49.307818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T04:41:49.311639Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.311639Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:d22ecd17435023058fc6d0e3bad3dd937f96a3e780df770a2368ef285ecf74bf","observation_id":"fbc00eb2-95f9-4cd3-9850-7c03039d5698","resolution":{"observed_at":"2026-08-16T04:41:49.311639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.315769Z","title":"G., Khiem, L., Pham, Q., Nguyen, T., Doan, T.-N., Nguyen, B., Liu, C., Ramasamy, S., Li, X., and Hoi, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.315769Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:090c872229d427ab3ea2b5b4d098c19c2008f39d0b3b195b5bb20e2f09e9e4ed","observation_id":"1e6176cf-9ede-4272-a5e1-f83a86dc3849","resolution":{"observed_at":"2026-08-16T04:41:49.315769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.319793Z","title":"M., Tong, S., Lepikhin, D., Xu, Y., Krikun, M., Zhou, Y., Yu, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.319793Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:14e2f11e2331ff1491f0227c5e8ea980fb6b0248cf3f909e9bd9106cefb4aa4c","observation_id":"c3de1a7b-b25a-4c50-bdc4-3617550f88af","resolution":{"observed_at":"2026-08-16T04:41:49.319793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-14T22:45:56.335948Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-16T04:41:49.323771Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.323771Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:749e2461b5fafc76b1d3b022447acd4f3c1ebed8f07aa675abc092eb98c531d4","observation_id":"16ca6e7b-0172-4d75-b825-44897b7bfbcd","resolution":{"observed_at":"2026-08-16T04:41:49.323771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.328106Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.328106Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:2fe2b5097da29fe733425315afd4084cb8f7b87d836f4cb590d68b0f7493c788","observation_id":"42e4d662-7bc6-4cd4-b679-c85c0865159f","resolution":{"observed_at":"2026-08-16T04:41:49.328106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.987283Z","title":"J., Prasad, M., Ramabhadran, B., and Zhu, Y","venue":null,"work_id":"2e3e1242-0e36-4b2b-b874-ca5630a9109a","year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.332165Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:36047289e0315966dec7e6c042a1014d338db8f96433dfb69738f3a213e295e9","observation_id":"73a0f427-1f63-4f15-9e7e-e25108356697","resolution":{"observed_at":"2026-08-16T04:41:49.991461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.972633Z","title":null,"venue":null,"work_id":"e7cb9419-7ce6-4580-98cf-9fa8b1eba624","year":2011},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.336293Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:966b20f91c9a5e60a60776276e2cf4ac436e19bde3156ec9ab52b151c215140d","observation_id":"957cf370-fb1a-4110-ae3c-91cb635096b3","resolution":{"observed_at":"2026-08-16T04:41:49.977725Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.340602Z","title":"The elements of statistical learning: data mining, inference, and prediction, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.340602Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:2a7baeab915a54982e5c894c7ea99a98074d69e0e2e3c278b6d9e3a7a1e6a94e","observation_id":"1dba21a0-4bae-4d44-9cd0-6404ab2e0119","resolution":{"observed_at":"2026-08-16T04:41:49.340602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-15T10:34:34.836991Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-16T04:41:49.344601Z","title":"and Dietterich, T","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.344601Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:0a59da6cd6d6fe9829ee84d4c8379fc32e845a210173ff88aba3abebb8ec12b8","observation_id":"98b30599-6ab8-49fc-ab05-16de505eb8fc","resolution":{"observed_at":"2026-08-16T04:41:49.344601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.348797Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.348797Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:257771a774ebedc267d100ab7017bef4f2ae1a6b411e0e28b7971834f2fdb90c","observation_id":"5f9e1791-0bc9-4922-a123-ebbe533a1144","resolution":{"observed_at":"2026-08-16T04:41:49.348797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.352768Z","title":"Natural adversarial examples","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.352768Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:3b3e54ba7f05b4ba756beef2df40d55becd449ce87139085487596527ee1442f","observation_id":"a047196a-3ebe-4383-87c4-3235dafc592d","resolution":{"observed_at":"2026-08-16T04:41:49.352768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.356950Z","title":"A., Jordan, M","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.356950Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:8e2985b11045e031cddcd07841b4d69f2cb84fdd5270a3537c57eff94d013fb9","observation_id":"c926046c-2596-4e17-9527-110298cb8ce0","resolution":{"observed_at":"2026-08-16T04:41:49.356950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.361254Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.361254Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:f6cac64076c606999645ed9e62e0c79eac78aa536c904986b7dc2ccbe460595d","observation_id":"0f491505-d430-46f3-babb-060f223958f5","resolution":{"observed_at":"2026-08-16T04:41:49.361254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T04:41:49.364738Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.364738Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:d16f5041478be356756802435d1fba4693da8a3164370ded22c4fc7eee01192d","observation_id":"426087ba-cedf-4afc-8029-89f5cc844366","resolution":{"observed_at":"2026-08-16T04:41:49.364738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-16T04:41:49.368162Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.368162Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:ceced7edf8b22c2453fc9708bbbcc9457abf4c14172cd73874e69c5d0358b2f6","observation_id":"4a77115f-3c83-475b-818c-3c219107f5dc","resolution":{"observed_at":"2026-08-16T04:41:49.368162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.915846Z","title":"Base layers: Simplifying training of large, sparse models","venue":null,"work_id":"4cb647e5-dca9-421b-8ab4-253f918049d1","year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.372332Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:ef7f6a8005568dd32b87198897cb1efa91f9f45deeeec2fbf7c176edb1781c35","observation_id":"6f14c2d6-2c07-44cb-afaf-74cd402ebbc6","resolution":{"observed_at":"2026-08-16T04:41:49.920036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.375894Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.375894Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:d506fcf5631811d43f793790de2b845cdcd5e5df0c41f746aadabd35c94f5810","observation_id":"c174c9ad-56b1-47f3-87d5-adda57024036","resolution":{"observed_at":"2026-08-16T04:41:49.375894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.893977Z","title":"Sparsity-constrained optimal transport","venue":null,"work_id":"858c66ef-cb65-4ead-a5e4-f458dbd10bff","year":2023},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.379318Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:0b75ea643d86f7740636046ca4896bfa283684884fed987f7b95b3e8c1a9d040","observation_id":"c8b3506c-5a14-4f7b-91b1-176519a4802c","resolution":{"observed_at":"2026-08-16T04:41:49.898528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.880872Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"5e243ab2-2c00-4827-ab2c-a5e36f8a533a","year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.383379Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:01cb979d175a59318346ceadf449318c4a9b94f409c561c01d5a7726941350d8","observation_id":"c1bfdb5b-04ff-48bc-b22c-434db0a51333","resolution":{"observed_at":"2026-08-16T04:41:49.884648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-16T04:41:49.387051Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.387051Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:110782972189b30988ceada467d6863f255e2116885be632abbeffe89c031a0a","observation_id":"e1e34477-c18a-485c-9fa5-9ce15a9f582a","resolution":{"observed_at":"2026-08-16T04:41:49.387051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05909","last_updated":"2020-10-05T00:10:24Z","snapshot_observed_at":"2026-08-18T03:04:28.486504Z","submitted_at":"2020-04-29T21:33:35Z","title":"TextAttack: A Framework for Adversarial Attacks, Data Augmentation, and Adversarial Training in NLP","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05909","snapshot_observed_at":"2026-08-16T04:41:49.390654Z","title":"X., Lifland, E., Yoo, J","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.390654Z"},"links":{"cited_paper":"/paper/2005.05909","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:ebc60616750b43d7e72f6da4a4cfec10d88b36aa4e1e2224f6b125c9c9dc199b","observation_id":"8f6847ba-bca2-4b42-86d5-5839ccfc19f2","resolution":{"observed_at":"2026-08-16T04:41:49.390654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.868303Z","title":"and Dirk, W","venue":null,"work_id":"c0fe3fa5-b14e-46b3-9ef1-5cf0e48e6d02","year":2020},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.394960Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:c2996c02b832697d5d51339411e59f222d42fb5d0bb1c8f8856ff38623164367","observation_id":"a886e4e1-41ab-462b-b3a2-0b137b38cd83","resolution":{"observed_at":"2026-08-16T04:41:49.872044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00918","last_updated":"2026-07-25T23:45:29Z","snapshot_observed_at":"2026-08-19T04:12:35.070005Z","submitted_at":"2024-11-01T14:04:36Z","title":"LIBMoE: A Library for comprehensive benchmarking Mixture of Experts in Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00918","snapshot_observed_at":"2026-08-16T04:41:49.399135Z","title":"V., Doan, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.399135Z"},"links":{"cited_paper":"/paper/2411.00918","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:ccb2574d85f9e4b9e691e023249b99be843d8ad5468cd24c7989b7f02bd36cdb","observation_id":"45268bf7-d89e-4381-8509-e04344eb0a69","resolution":{"observed_at":"2026-08-16T04:41:49.399135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.855452Z","title":"T., Ramasamy, S., Li, X., Hoi, S., and Ho, N","venue":null,"work_id":"60d09f8e-e810-4993-9bd5-3fce2c2b1302","year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.404333Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:c1888d51c4d046295a0f8ad59138ccc14089f6c831a0eacbd7ef9576eeee331d","observation_id":"f513e85c-e0ab-48ba-89c5-a0d1606cb661","resolution":{"observed_at":"2026-08-16T04:41:49.859218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.408414Z","title":"A., and Levy, O","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.408414Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:33983adf7577a210b06dbf1da71a435a79ca96186733473b345cb09d6be9a571","observation_id":"1c772cb6-b7c5-4312-a532-6fb4a7d7a301","resolution":{"observed_at":"2026-08-16T04:41:49.408414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.413019Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.413019Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:b7778f2027dcef0c419bb1ef0bde16bbd8db73af9987e78f31d6025b2e2931a3","observation_id":"ac473c5d-26fc-4572-86b0-d1d6ebc826c3","resolution":{"observed_at":"2026-08-16T04:41:49.413019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.417426Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.417426Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:65a873a02043c0cd8c315faf7166c26e2022e55c8fe7998c90d1a446f17ab96e","observation_id":"3889dfe5-278a-4791-be5a-6ec13acf2478","resolution":{"observed_at":"2026-08-16T04:41:49.417426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.421935Z","title":"Scaling vision with sparse mixture of experts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.421935Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:d1b1b13392582003e779ce1b976dba12b6f43dd73ab444bf7f45247a7c1896a2","observation_id":"11915f05-2819-44e8-b1e9-bd07e47430ae","resolution":{"observed_at":"2026-08-16T04:41:49.421935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.817339Z","title":"Hash layers for large sparse models","venue":null,"work_id":"98c0a47b-0f50-4ee4-9a3b-326df28bf592","year":2021},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.426386Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:385e03d9beb7c04cbe841ab6721ac41b6f30723e9cdc5f39f1f2779d813bad16","observation_id":"710b93d8-5638-4cf1-b985-d283d656fea2","resolution":{"observed_at":"2026-08-16T04:41:49.821877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-16T04:41:49.430656Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.430656Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:5714ba3846e3c93195dd8c691354eff29c64002fbb088c3100edf9b98582d540","observation_id":"7c768ff8-7bc5-4a52-b381-687c19e78335","resolution":{"observed_at":"2026-08-16T04:41:49.430656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.435169Z","title":"D., Ng, A., and Potts, C","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.435169Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:8ddda464947df5571018514d21e89db33bd44d70faa27dc011e43b02bd7e9436","observation_id":"68130f9e-97e9-4416-b0a4-57e8cbf423c5","resolution":{"observed_at":"2026-08-16T04:41:49.435169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09816","last_updated":"2024-08-29T08:45:58Z","snapshot_observed_at":"2026-08-16T13:34:33.201721Z","submitted_at":"2024-07-13T09:22:33Z","title":"MaskMoE: Boosting Token-Level Learning via Routing Mask in Mixture-of-Experts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09816","snapshot_observed_at":"2026-08-16T04:41:49.439539Z","title":"Maskmoe: Boosting token-level learning via routing mask in mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.439539Z"},"links":{"cited_paper":"/paper/2407.09816","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:1451cc710e62b47a61195658d9b792e66147198c15e394a7abdfa6bfe4a9ea3e","observation_id":"1904b808-0b12-40dc-9745-fd0543cd9fa8","resolution":{"observed_at":"2026-08-16T04:41:49.439539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.444109Z","title":"W., and Gholami, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.444109Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:edda27c99ab3f2db38c9fd3f4dbbe3c9b1dfc6ecd81179b382700046f5209fef","observation_id":"637516eb-f620-47d3-8e10-c2fb903c6228","resolution":{"observed_at":"2026-08-16T04:41:49.444109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.448298Z","title":"Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.448298Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:9544cd5df5ce5ae02d0a64ce4d0bc8630528418a803a18addfa403c7ceaebbbf","observation_id":"52583df4-7607-4081-a8c2-755b67dc95c4","resolution":{"observed_at":"2026-08-16T04:41:49.448298Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-16T04:41:49.452860Z","title":"St-moe: Designing stable and transferable sparse expert models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.452860Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:d72c16eb54a0aa2b9c9412ba00a01d2f2b1b9b02baa5afbd652655d18b9f7016","observation_id":"ab945936-77cb-49d1-9189-410bafbe265d","resolution":{"observed_at":"2026-08-16T04:41:49.452860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.457379Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.457379Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:a845e54ac918c26e9501a670d0d6c406fb5ee989eed6b650c9b7b48defab6b8d","observation_id":"454c4dcf-a6fd-41cf-94e8-4d904121c53f","resolution":{"observed_at":"2026-08-16T04:41:49.457379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.462470Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.462470Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:2be84ae91c6fa3860deedc4a9ec9635acdab793410ba47c48ad2ef0452c7eef7","observation_id":"f39ae6b2-0c51-4699-8da3-cd486cf3c9f4","resolution":{"observed_at":"2026-08-16T04:41:49.462470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.466997Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.466997Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:79bd65be353b9fe3e9fc48b72bb83e5972da9d47be0ca73b8a00535899c53500","observation_id":"dab9066e-411f-475e-85ac-3a84faef658d","resolution":{"observed_at":"2026-08-16T04:41:49.466997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:41:49.759484Z","title":null,"venue":null,"work_id":"ccfe77e0-fd6b-4ca9-91f5-d9c1db3d7a3d","year":null},"citing_paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T04:41:49.471089Z"},"links":{"citing_paper":"/paper/2505.00792"},"observation_digest":"sha256:b7212effb65289ebaf44f30379d8d6b4a5035bf1d19679e5bc4ed22157a30638","observation_id":"2cf6e69d-da46-4b9d-9ca4-048135bd3a12","resolution":{"observed_at":"2026-08-16T04:41:49.763846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00792","last_updated":"2025-05-01T18:44:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T19:00:16.700989Z","submitted_at":"2025-05-01T18:44:20Z","title":"Improving Routing in Sparse Mixture of Experts with Graph of Tokens"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2505.00792."}