{"as_of":"2026-08-13T20:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d241233e0f5ac28fac8d1580cb7c39af06a4d545bba5f96874766994dc8e5390","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:20:59.524307Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.01951/citation-record","integrity":"/paper/2501.01951/integrity","json":"/paper/2501.01951/citation-record.json","paper":"/paper/2501.01951"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1603.04467","last_updated":"2016-03-16T16:57:12Z","snapshot_observed_at":"2026-07-06T04:49:28.300758Z","submitted_at":"2016-03-14T20:50:20Z","title":"TensorFlow: Large-Scale Machine Learning on Heterogeneous Distributed Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.04467","snapshot_observed_at":"2026-08-10T22:20:58.638267Z","title":"Tensorflow: Large-scale machine learning on heteroge- neous distributed systems","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.638267Z"},"links":{"cited_paper":"/paper/1603.04467","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:d8eaf4092b5ff2eaf60c5518f13c5dfd65d09dc6f584dfc5a9578b4098067640","observation_id":"e46f153a-cbc2-41ab-a5d4-9574eadb917d","resolution":{"observed_at":"2026-08-10T22:20:58.638267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.644621Z","title":"Hardware accel- eration of graph neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.644621Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:26550af047e477b8d608693052f556c3441f2615a6cbb7d55ebb65ed5508a7b0","observation_id":"d1e82c4d-b714-4cef-9c66-73a1f30aeca0","resolution":{"observed_at":"2026-08-10T22:20:58.644621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13466","last_updated":"2023-12-10T14:56:21Z","snapshot_observed_at":"2026-08-13T10:27:34.647707Z","submitted_at":"2023-08-25T16:10:44Z","title":"Staleness-Alleviated Distributed GNN Training via Online Dynamic-Embedding Prediction","version":2},"cited_work":{"arxiv_id":"2308.13466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.13466","snapshot_observed_at":"2026-08-10T22:21:01.145893Z","title":"Staleness-Alleviated Distributed GNN Training via Online Dynamic-Embedding Prediction","venue":"cs.LG","work_id":"bdea936e-7a0a-485c-b997-27898ee0d09f","year":2023},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.649361Z"},"links":{"cited_paper":"/paper/2308.13466","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:552d02a1deda2727df57ebe1dce9b7b1f4a5073208b7e2f96a846550bfdf29b4","observation_id":"3274501f-e5b7-4c70-bcbc-1033bcbd988a","resolution":{"observed_at":"2026-08-10T22:21:01.160978Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.654099Z","title":"Pathways: Asynchronous distributed dataflow for ml","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.654099Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:08af96b572024160bead0d39e700ba7813176ef33cf049ec29b141a0cb1a63ef","observation_id":"e5c96f4a-508a-488b-b7d7-4d6674f254ff","resolution":{"observed_at":"2026-08-10T22:20:58.654099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00057","last_updated":"2022-10-02T16:07:10Z","snapshot_observed_at":"2026-08-13T15:32:51.720015Z","submitted_at":"2022-05-31T18:44:53Z","title":"Distributed Graph Neural Network Training with Periodic Stale Representation Synchronization","version":2},"cited_work":{"arxiv_id":"2206.00057","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00057","snapshot_observed_at":"2026-08-10T22:21:01.069056Z","title":"Distributed Graph Neural Network Training with Periodic Stale Representation Synchronization","venue":"cs.LG","work_id":"d8cb039d-0171-45c4-87bd-c8a5b4a3b4b3","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.660107Z"},"links":{"cited_paper":"/paper/2206.00057","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:80697c151f27bee3e1aeb71748aa0bc0e350f02783d44e162b19c7387500b382","observation_id":"7245acf2-1add-4ba5-ab32-3ce031209894","resolution":{"observed_at":"2026-08-10T22:21:01.078748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.668865Z","title":"Dygnn: Algorithm and architecture support of dynamic pruning for graph neural net- works","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.668865Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:8c98c4a138c045a19a3601700c65231ecb587049f6cc3fabcfe2b42db1893e45","observation_id":"81aa9a1f-8148-42a1-84b6-a145c7c84759","resolution":{"observed_at":"2026-08-10T22:20:58.668865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.675487Z","title":"Graph representation learning: a survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.675487Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:250554ef3403600d894093eaff93ba8a53960e3b53d3f42875e7fdcc2211f86b","observation_id":"e951a0f3-c9e8-4880-a91d-24df1d98633d","resolution":{"observed_at":"2026-08-10T22:20:58.675487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.01274","last_updated":"2015-12-03T22:49:21Z","snapshot_observed_at":"2026-08-10T17:07:11.368395Z","submitted_at":"2015-12-03T22:49:21Z","title":"MXNet: A Flexible and Efficient Machine Learning Library for Heterogeneous Distributed Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.01274","snapshot_observed_at":"2026-08-10T22:20:58.681665Z","title":"Mxnet: A flexible and efficient machine learning library for heterogeneous distributed systems","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.681665Z"},"links":{"cited_paper":"/paper/1512.01274","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:973cb55a63353e609c82f802b34ffcbed09fbf3547a6eab961232d318f87902b","observation_id":"a900a66c-853e-4fec-9910-0341ed2d1577","resolution":{"observed_at":"2026-08-10T22:20:58.681665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.687941Z","title":"Rubik: A hierarchical architecture for efficient graph neural network training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.687941Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:aaba129031e7472f91451919b30ad6d63147810dc43882baf4f4c3982fb8fc12","observation_id":"265278f4-a1ab-461e-9c46-63c206dce10c","resolution":{"observed_at":"2026-08-10T22:20:58.687941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.695359Z","title":"The bandwidth problem for graphs and matrices—a survey","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.695359Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:a29bec3d9ed09a67fdfb9c2a4cb79eb5f80a04e088b51e477ba78b3aa4aba49d","observation_id":"f1dfa1f2-f91a-4a3a-a18f-fe22a470139d","resolution":{"observed_at":"2026-08-10T22:20:58.695359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.708177Z","title":"Reducing the bandwidth of sparse symmetric matrices","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.708177Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:17951bea9cad9fd4d995efe94b7fb748aab9f1932bc6a7a6d27ba59b3c46e228","observation_id":"900c8cf9-a8eb-46bf-8836-e18c85657a60","resolution":{"observed_at":"2026-08-10T22:20:58.708177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.715413Z","title":"Hardware acceleration of sparse and irregular tensor computations of ml models: A survey and insights","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.715413Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:95a27cc09e81ff33883643d44025026e81eec7a27f1ebe8bf79fda1a27935914","observation_id":"3c5b3bc4-135b-4bf8-b227-e9ef3509220c","resolution":{"observed_at":"2026-08-10T22:20:58.715413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-11T09:09:15.043235Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-10T22:20:58.720956Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.720956Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:6a73709bc9a98021fad3796b36fbebde99738a50082b7ba9aa7860f5971552f8","observation_id":"83f84d04-ce23-495c-a5e2-f37b943c8769","resolution":{"observed_at":"2026-08-10T22:20:58.720956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05609","last_updated":"2021-06-10T09:26:56Z","snapshot_observed_at":"2026-07-06T11:17:55.927608Z","submitted_at":"2021-06-10T09:26:56Z","title":"GNNAutoScale: Scalable and Expressive Graph Neural Networks via Historical Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05609","snapshot_observed_at":"2026-08-10T22:20:58.727043Z","title":"Gn- nautoscale: Scalable and expressive graph neural networks via histori- cal embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.727043Z"},"links":{"cited_paper":"/paper/2106.05609","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:7229e147061a2f19118cf6cb23dd7b316e9e754ecd56fe383b62a15c4496a170","observation_id":"f0113c2e-fa3e-447b-9752-ce615c03ca3a","resolution":{"observed_at":"2026-08-10T22:20:58.727043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.733191Z","title":"Tlpgnn: A lightweight two- level parallelism paradigm for graph neural network computation on gpu","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.733191Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:f8b3af36b26badfe17e3e6fc8369173124fcfe51d4daf8dc99136f5b1e2d75be","observation_id":"0651de6c-f8bc-472b-a9f7-ca3cd0786885","resolution":{"observed_at":"2026-08-10T22:20:58.733191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.743084Z","title":"P3: Distributed deep graph learning at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.743084Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:537cfec1930d6363e0da3b922c528a1f9eeb41813de12e37faec5d87ee65a65b","observation_id":"bef0258f-a19c-4a8e-a99f-3d345a12397c","resolution":{"observed_at":"2026-08-10T22:20:58.743084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07977","last_updated":"2022-03-07T01:17:27Z","snapshot_observed_at":"2026-08-13T19:58:32.874754Z","submitted_at":"2021-03-14T17:14:13Z","title":"Understanding the Design-Space of Sparse/Dense Multiphase GNN dataflows on Spatial Accelerators","version":3},"cited_work":{"arxiv_id":"2103.07977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.07977","snapshot_observed_at":"2026-08-10T22:21:00.906707Z","title":"Understanding the Design-Space of Sparse/Dense Multiphase GNN dataflows on Spatial Accelerators","venue":"cs.DC","work_id":"ad07ed51-1313-436b-a21f-d47a03f90821","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.752395Z"},"links":{"cited_paper":"/paper/2103.07977","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:a6cfb3a28368ffbfedc6c098962eaaa74ff776205cd46dc04b07f692b669fe8a","observation_id":"ddb8f1d2-30fb-4930-9934-726a654b23c9","resolution":{"observed_at":"2026-08-10T22:21:00.914804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.760701Z","title":"Awb-gcn: A graph convolutional network accelerator with runtime workload rebalancing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.760701Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:091899c57b2018abd365978acc3b28a85f3cfbb53e84336427ffac9cd0c7060a","observation_id":"d30f8ec6-fb6f-4104-a5b9-a4e777ee08fb","resolution":{"observed_at":"2026-08-10T22:20:58.760701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.766827Z","title":"I-gcn: A graph convolutional network accelerator with runtime locality enhancement through islandization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.766827Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:f78f4ca47f19b64e546b909e5a7d9449b97a0cf50e7ab81d25cb17fcdb8bdaa8","observation_id":"1dd4b653-4062-4595-b968-f8daa27bc569","resolution":{"observed_at":"2026-08-10T22:20:58.766827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.774832Z","title":"Data-efficient graph grammar learning for molecu- lar generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.774832Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:48708d0c004bbc97f665acf2de562026667c3afdf2049aa354140277f8a34ad8","observation_id":"1c2058d1-43f6-4f1b-8054-b49b731acfe8","resolution":{"observed_at":"2026-08-10T22:20:58.774832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:03.110872Z","title":"Inductive represen- tation learning on large graphs","venue":null,"work_id":"f345bc41-542f-4ed8-b9c5-0d63b23893ee","year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.781848Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:3bad5e7af17b788dee252a7de55770a5959ac455616c082edf6b4031ad9034af","observation_id":"d8d3438f-15be-42e0-a6a2-0bfc03f92b6c","resolution":{"observed_at":"2026-08-10T22:21:03.123452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03377","last_updated":"2018-06-08T23:18:08Z","snapshot_observed_at":"2026-08-02T18:12:03.258298Z","submitted_at":"2018-06-08T23:18:08Z","title":"PipeDream: Fast and Efficient Pipeline Parallel DNN Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03377","snapshot_observed_at":"2026-08-10T22:20:58.789532Z","title":"Pipedream: Fast and efficient pipeline parallel dnn training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.789532Z"},"links":{"cited_paper":"/paper/1806.03377","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:c1c5d5e5929cd3c7e990d3f3949a2a4f9772e6b0da21c1db771e16fe618cb765","observation_id":"0d08922e-937e-4b4f-8655-414507764227","resolution":{"observed_at":"2026-08-10T22:20:58.789532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00687","last_updated":"2021-02-25T02:06:27Z","snapshot_observed_at":"2026-08-09T05:17:43.055948Z","submitted_at":"2020-05-02T03:09:50Z","title":"Open Graph Benchmark: Datasets for Machine Learning on Graphs","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00687","snapshot_observed_at":"2026-08-10T22:20:58.810421Z","title":"Open graph benchmark: Datasets for machine learning on graphs","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.810421Z"},"links":{"cited_paper":"/paper/2005.00687","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:1e93ba3f4420a5600acf648f61ba70c71dbf33d8645891fcb0cace8823a99c07","observation_id":"08c0e4d8-8ded-42a4-9b44-487f86315581","resolution":{"observed_at":"2026-08-10T22:20:58.810421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:03.081311Z","title":"Recurrent graph convolutional network-based multi- task transient stability assessment framework in power system","venue":null,"work_id":"455ecc13-56d4-46a7-bb7c-e82a3bdc3c2d","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.818299Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:87cdfce2570d4461d5283195103c4fc3ffd2a5b0d3b7f0c73e8a2c7038990a13","observation_id":"2934b5ee-8cfa-4ddd-b4e2-150e63895935","resolution":{"observed_at":"2026-08-10T22:21:03.089163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:03.058160Z","title":"Wisegraph: Optimizing gnn with joint workload partition of graph and operations","venue":null,"work_id":"428ffba1-6180-4c26-92f1-4a268d1ceb10","year":2024},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.824637Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:635cf2c76e0ef9efedf2ff34050c542aa5183788bfd8652e82c32947ec4b8cf6","observation_id":"a1a61f0a-9771-4f8d-a903-250a3949abdb","resolution":{"observed_at":"2026-08-10T22:21:03.063763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:03.020377Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":"0951ede7-0932-45d2-bc6a-3142f064f9d9","year":2019},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.838644Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:72dc46e74d236a05d880b9df6d1b9b0e269c2c67dbede9255801c897f57491b7","observation_id":"6638afb0-1936-4479-aa12-9858d99f90fc","resolution":{"observed_at":"2026-08-10T22:21:03.032277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17145","last_updated":"2024-10-28T13:44:30Z","snapshot_observed_at":"2026-08-12T23:35:43.654060Z","submitted_at":"2024-06-24T21:32:51Z","title":"GraphPipe: Improving Performance and Scalability of DNN Training with Graph Pipeline Parallelism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17145","snapshot_observed_at":"2026-08-10T22:20:58.846946Z","title":"Graphpipe: Improving performance and scala- bility of dnn training with graph pipeline parallelism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.846946Z"},"links":{"cited_paper":"/paper/2406.17145","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:4462ce7beaca45dc253945a8ec3752e4ccc42d0f650f4f71608cbbeea4c42670","observation_id":"f14914ea-757b-45b0-943f-5a814e9559a1","resolution":{"observed_at":"2026-08-10T22:20:58.846946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.994864Z","title":"A survey on knowledge graphs: Representation, acquisition, and applications","venue":null,"work_id":"88b58ff0-9468-4f7a-b5ca-17a2e0aaf1a5","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.854077Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:0526e26cd33bdfb3b1294138c3a966c8b0133b336cbdf33812fac612e9ee27f4","observation_id":"f248b074-31e6-4104-8cdd-03d2de625884","resolution":{"observed_at":"2026-08-10T22:21:03.001880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.959340Z","title":"Improving the accuracy, scalability, and performance of graph neural networks with roc","venue":null,"work_id":"388e4cca-4d0f-4b6d-a4e1-fe332ebb1b49","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.863186Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:ad94d148e3868edee95a696e6f9c8fe129f942a056b395723f2af6799d1a0535","observation_id":"142d96fe-707b-4af4-9af6-a87d94a4b1ab","resolution":{"observed_at":"2026-08-10T22:21:02.968211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.904428Z","title":"A survey of frequent subgraph mining algorithms","venue":null,"work_id":"1861a054-46aa-461e-919e-192eba606669","year":2013},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.886748Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:e198303311dbfa4c01a5064577b87c2da910b6f1e796fbf88f2ab99853b42895","observation_id":"5cb57111-06b2-458e-b51d-5e2e411d6aed","resolution":{"observed_at":"2026-08-10T22:21:02.919586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.868678Z","title":"A unified architecture for accelerating distributed{DNN} 12 training in heterogeneous{GPU/CPU} clusters","venue":null,"work_id":"d5fb0b92-e45a-4223-a351-1d5cf382a73f","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.896202Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:151a9736292600bf155c7aa012b24215f192a1d0c7e5ffde6eef429991fd1bb8","observation_id":"d437af7a-a70e-4d9e-b372-789939763c32","resolution":{"observed_at":"2026-08-10T22:21:02.882539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.811629Z","title":"In-datacenter performance analysis of a tensor pro- cessing unit","venue":null,"work_id":"32f2dec6-8475-4b29-ab6e-faa5bcf27c6d","year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.902286Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:9b4fae4ceab9c3d790e869bda95296f0ed5b466ba82e6634a1c0be945343fa8f","observation_id":"b146ab98-1339-41ed-90f4-9b76ef32289f","resolution":{"observed_at":"2026-08-10T22:21:02.832052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.774075Z","title":"A fast and high quality multilevel scheme for partitioning irregular graphs","venue":null,"work_id":"bc1462d2-9dc0-4fbe-a3cf-10aa45329250","year":1998},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.914019Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:c5381635b01603758bbeea7c68560fdad94b9d1fc16590c9229ee56ce2da17e8","observation_id":"28f1548c-1997-4beb-a394-7b0b5127c010","resolution":{"observed_at":"2026-08-10T22:21:02.780051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.13828","last_updated":"2020-07-30T07:55:13Z","snapshot_observed_at":"2026-08-11T17:07:18.630254Z","submitted_at":"2020-07-27T19:44:51Z","title":"GRIP: A Graph Neural Network Accelerator Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.13828","snapshot_observed_at":"2026-08-10T22:20:58.923650Z","title":"Grip: A graph neu- ral network accelerator architecture","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.923650Z"},"links":{"cited_paper":"/paper/2007.13828","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:5f45c3294ac9b1ed067e8182681ab7da65a5441b6f939bb8a5e208173d311a7f","observation_id":"6c470d37-b9c5-47f3-a7b0-fe75d054b951","resolution":{"observed_at":"2026-08-10T22:20:58.923650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.02907","last_updated":"2017-02-22T09:55:36Z","snapshot_observed_at":"2026-08-13T11:38:10.906031Z","submitted_at":"2016-09-09T19:48:41Z","title":"Semi-Supervised Classification with Graph Convolutional Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.02907","snapshot_observed_at":"2026-08-10T22:20:58.935775Z","title":"Semi-supervised classification with graph convolutional networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.935775Z"},"links":{"cited_paper":"/paper/1609.02907","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:97791b28662f3c8f55c6a1e3c47fc18cbb9922a70e24d3102eded093c37e2018","observation_id":"91348ac9-53df-4283-873e-70b652883e0b","resolution":{"observed_at":"2026-08-10T22:20:58.935775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.747023Z","title":"What is twitter, a social network or a news media? InProceedings of the 19th international conference on World wide web , pages 591–600, 2010","venue":null,"work_id":"63647529-d39e-4be9-b27e-0af2919903fc","year":2010},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.941452Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:7bec143b18960de48478e6cb1fa388557eba4a9bd767ebd06b5c833b45f1c70b","observation_id":"a5d7c67d-96a7-4e0e-b2ef-24c445cd0cf4","resolution":{"observed_at":"2026-08-10T22:21:02.754966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.724760Z","title":"Maeri: En- abling flexible dataflow mapping over dnn accelerators via reconfig- urable interconnects","venue":null,"work_id":"5fd48328-b7ef-4a58-8d60-9205daab47a3","year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.950658Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:96e91b5aeb828c1b059046b6493348384612762639f55e4707f53fd1532b742e","observation_id":"3916394e-82ee-480e-bedd-607716e4c432","resolution":{"observed_at":"2026-08-10T22:21:02.734867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-10T22:20:58.960665Z","title":"Gshard: Scaling giant models with conditional com- putation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.960665Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:2928f2b5832c67b4201f81a9a437b90036ce2863cd99033448b91c584953a8f4","observation_id":"85fb448c-8df8-422d-988e-ffa53899f03c","resolution":{"observed_at":"2026-08-10T22:20:58.960665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.699964Z","title":"Gcnax: A flexible and energy-efficient accelerator for graph convolutional neural networks","venue":null,"work_id":"dfcf4685-608b-4acd-a81f-28f9c66bfa86","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.972154Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:4703988d5a75475283698f6dea88a3d927f1256015c628687c594f88dfd49bdf","observation_id":"98849045-ddec-4b1f-894f-826f52e88d75","resolution":{"observed_at":"2026-08-10T22:21:02.708857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-10T22:20:58.982658Z","title":"Pytorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.982658Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:6317bd62850c258a9eb188a8946bc821d8c47f529f22b693a8aa4bd7fe8cd223","observation_id":"20c0a3b0-4df1-44ea-969e-fd7f04788898","resolution":{"observed_at":"2026-08-10T22:20:58.982658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:58.994822Z","title":"Terapipe: Token-level pipeline parallelism for training large-scale language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:58.994822Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:87037ad2bc38cd978597aca2c856dcd484963925c5f1a6fadccf016bec7bd738","observation_id":"1f7421e2-3a0b-4046-a37d-35e0bb6c16f3","resolution":{"observed_at":"2026-08-10T22:20:58.994822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.623713Z","title":"Engn: A high-throughput and energy-efficient accelerator for large graph neural networks","venue":null,"work_id":"47649fd0-b90f-4615-b236-c4ba7ea04fa6","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.016949Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:375f711bad02ad502e0818a3320eb65981c269bca08f70f45aab4b1f590e1909","observation_id":"93ebb486-cd12-4c14-9b03-f6eab1dcceb8","resolution":{"observed_at":"2026-08-10T22:21:02.632501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.590366Z","title":"Nvidia tesla: A unified graphics and computing architecture","venue":null,"work_id":"341bafda-5715-4954-9df1-580af451a766","year":2008},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.030513Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:c993b9872d1a052a902547ff7290f08ec69674eafff34ca09704db9de5bcb6a4","observation_id":"09e3ddb5-ab50-4d88-8004-35428db90a82","resolution":{"observed_at":"2026-08-10T22:21:02.600956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.558592Z","title":"Flexflow: A flexible dataflow accelerator architecture for convolutional neural networks","venue":null,"work_id":"b1708fb7-ce95-4f34-8fd9-7b80c48abed6","year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.036783Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:492f861ac95242c4b852e9f814b4ab837c35eaff17b9a178130418865acd9509","observation_id":"f98bde13-0dfc-4c84-a9cf-127e05790520","resolution":{"observed_at":"2026-08-10T22:21:02.566211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.526659Z","title":"NeuGraph: Parallel deep neural network compu- tation on large graphs","venue":null,"work_id":"7520b40a-720d-4b39-831b-9ac1b85a51f4","year":2019},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.042719Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:e11ed6ff42e79de2a825c28c93692d0c932861230f14d8ae8d1193e90bf7541f","observation_id":"490a054e-7ca0-47b8-a6ec-a7c963318011","resolution":{"observed_at":"2026-08-10T22:21:02.539604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.480059Z","title":"All-to-all personalized communication on multi- stage interconnection networks","venue":null,"work_id":"d9c5d6f1-d518-4516-96d2-c057d959b087","year":2003},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.052182Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:be0fd652c335a79eb12465708e8a3a8778f16aad48ab72cec5725ceb95691a05","observation_id":"3978c9b6-e306-4a77-a3a5-a133550d9d88","resolution":{"observed_at":"2026-08-10T22:21:02.494811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.438807Z","title":"Distgnn: Scalable distributed training for large-scale graph neural networks","venue":null,"work_id":"0c5e9515-4b53-4213-a9ee-f31bb393c762","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.060848Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:f572a43a60b42abd83c4532a365de24432f71e375b417070affcd0cfb6a66949","observation_id":"6d4041c5-da6a-4b3c-8e98-05c1ebcd25d3","resolution":{"observed_at":"2026-08-10T22:21:02.447000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.406834Z","title":"Device placement optimization with reinforce- ment learning","venue":null,"work_id":"a52007df-f88d-4f43-b639-b6b2b24ae898","year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.071093Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:7659c09255922079db0d8bf24160cf3bb6dcd77bd8a4a12ff1a0a6ded00936ac","observation_id":"319f8905-194a-4c96-ad85-c462b4296de9","resolution":{"observed_at":"2026-08-10T22:21:02.418462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.351221Z","title":"Pipedream: generalized pipeline parallelism for dnn train- ing","venue":null,"work_id":"14188431-5ae8-42dc-9a29-9b69bf33cffd","year":2019},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.079779Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:8ab79f436c8e144729dd4e0733cadd6382832679e2c7ee079c0e00d2d5a0b83f","observation_id":"7e67f924-4cc7-4353-9169-75fe0bf7825b","resolution":{"observed_at":"2026-08-10T22:21:02.364659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.320446Z","title":"Sancus: staleness-aware communication-avoiding full- graph decentralized training in large-scale graph neural networks","venue":null,"work_id":"ecad89fd-55c0-4d7c-a613-f7f8ff7df0e0","year":1937},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.089244Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:0ea0ce5efa57f1e9f11a324f89f9258fbe463d924a779a7f009f690713bd944a","observation_id":"380d05f5-8580-4e87-a785-73e8589f9d2d","resolution":{"observed_at":"2026-08-10T22:21:02.329105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.254209Z","title":"Fusedmm: A unified sddmm-spmm kernel for graph embedding and graph neural networks","venue":null,"work_id":"935977dd-e2a3-482c-b17a-0abdeec013af","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.095388Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:cb5f99e67cb44cc8cde28765ccc9182b6f2b23ddb85d358bc5af997009e088c1","observation_id":"65ed8d03-a91c-4252-b1bc-862013eeeb46","resolution":{"observed_at":"2026-08-10T22:21:02.274773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-08-13T16:59:05.099994Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-10T22:20:59.102053Z","title":"Deepspeed-moe: Advancing mixture-of-experts infer- ence and training to power next-generation ai scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.102053Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:2a90d9dc9085dc39afb955a237eaef4143c587b3b1f33429d120c421697b3b9b","observation_id":"65049aef-5c7d-47a0-8808-3a526f13763e","resolution":{"observed_at":"2026-08-10T22:20:59.102053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:59.108981Z","title":"Zero: Memory optimizations toward training trillion parameter mod- els","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.108981Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:24fa6caf46d65d54e307f6e221ad859a48980eaa71e8d69e9b02ac7ec1490571","observation_id":"d8d35684-346d-4b49-8179-8094f6c961fa","resolution":{"observed_at":"2026-08-10T22:20:59.108981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08202","last_updated":"2022-03-13T14:51:02Z","snapshot_observed_at":"2026-08-13T17:33:31.174749Z","submitted_at":"2021-11-16T03:07:01Z","title":"Learn Locally, Correct Globally: A Distributed Algorithm for Training Graph Neural Networks","version":4},"cited_work":{"arxiv_id":"2111.08202","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08202","snapshot_observed_at":"2026-08-10T22:21:00.470777Z","title":"Learn Locally, Correct Globally: A Distributed Algorithm for Training Graph Neural Networks","venue":"cs.LG","work_id":"dc71aea4-17dd-4955-9686-6d3d189e8420","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.117725Z"},"links":{"cited_paper":"/paper/2111.08202","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:f9721363dc4f6da9d3eee9e7422132f1aebb0d86412d35eff804d00e08346f7d","observation_id":"0a54229d-d23b-45e2-aa60-ea1ce748168c","resolution":{"observed_at":"2026-08-10T22:21:00.479807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.181681Z","title":"Deepspeed: System optimizations enable training deep learning mod- els with over 100 billion parameters","venue":null,"work_id":"2f1a4e68-e9ed-43fc-8082-2fb1813a9d43","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.126880Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:afcf34f94795e6e1388ecb8aca462451c812b600cf5f74fdffb2d24357792b47","observation_id":"8ee42cb4-310e-4f75-a8ce-ece2d785048e","resolution":{"observed_at":"2026-08-10T22:21:02.207314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.138351Z","title":"Algorithms for scheduling independent tasks","venue":null,"work_id":"8552209c-0cb6-4d16-8bb4-edfb6ff22e57","year":1976},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.137669Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:bf7364539db325421c143221629c67ac8bed0fa3619b691c4ff5abd189b3cb89","observation_id":"c1a24337-6191-4dc6-9f27-cccc75667223","resolution":{"observed_at":"2026-08-10T22:21:02.150058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05799","last_updated":"2018-02-21T04:30:30Z","snapshot_observed_at":"2026-07-06T06:23:45.215820Z","submitted_at":"2018-02-15T23:36:51Z","title":"Horovod: fast and easy distributed deep learning in TensorFlow","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05799","snapshot_observed_at":"2026-08-10T22:20:59.150042Z","title":"Horovod: fast and easy dis- tributed deep learning in tensorflow","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.150042Z"},"links":{"cited_paper":"/paper/1802.05799","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:f2506ae053c64661b5075b7840896af4a4d40bef0a16fc59e6245d58fd0024b4","observation_id":"9189f8bc-bdda-46c3-82ba-50abd2636540","resolution":{"observed_at":"2026-08-10T22:20:59.150042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.111802Z","title":"Mesh-tensorflow: Deep learning for supercomputers","venue":null,"work_id":"82cefb69-4bcc-4762-9a9e-7873f67ea4fa","year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.161184Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:378417df39003d5c362704096f26b5c413534aa1c5a43146e75e1fcb6a0f3868","observation_id":"8a880ebf-9a11-49ce-8d5a-8122d0ec683e","resolution":{"observed_at":"2026-08-10T22:21:02.121015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T22:20:59.171908Z","title":"Megatron-lm: Training multi- billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.171908Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:b9b55c76c2e77c771e7df8bfaa29629b22cadcf81f260f77072e319706e6cda1","observation_id":"40d352c3-29c8-49c0-aaf0-24533ccba5ce","resolution":{"observed_at":"2026-08-10T22:20:59.171908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.081827Z","title":"Synopsys design compiler","venue":null,"work_id":"43e718b4-50b3-4ae5-9981-2788f43dabd0","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.181983Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:41032783b72253ae8b48621e290634dab26d4c015d8191935bb0c8964658852c","observation_id":"f4e393ec-e838-4319-9bfb-d610633b99d3","resolution":{"observed_at":"2026-08-10T22:21:02.091513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.044894Z","title":"Dorylus: affordable, scalable, and accurate gnn training with distributed cpu servers and serverless threads","venue":null,"work_id":"a87197e5-6c7f-4cfc-98f4-ac9f00bb58ee","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.191790Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:6b99fb278db536239e3c378e28889ecb7da6ab4662f216b79d9092188c9270a2","observation_id":"9cd0c7a5-d439-4097-8b41-4bdc58782e50","resolution":{"observed_at":"2026-08-10T22:21:02.056078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03300","last_updated":"2020-09-02T20:35:32Z","snapshot_observed_at":"2026-08-03T22:58:32.716336Z","submitted_at":"2020-05-07T07:45:09Z","title":"Reducing Communication in Graph Neural Network Training","version":3},"cited_work":{"arxiv_id":"2005.03300","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.03300","snapshot_observed_at":"2026-08-10T22:21:00.309640Z","title":"Reducing Communication in Graph Neural Network Training","venue":"cs.LG","work_id":"2b7c0df6-5e31-4cda-9dbd-cbd291246c4c","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.199116Z"},"links":{"cited_paper":"/paper/2005.03300","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:ba10c28a984fb7ba5c7b7a983f5be4ae409d429f073181dfec397efd10d677e0","observation_id":"a4d33c43-7177-494e-9fe3-f78a192c8417","resolution":{"observed_at":"2026-08-10T22:21:00.319132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10903","last_updated":"2018-02-04T19:13:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-10-30T12:41:12Z","title":"Graph Attention Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10903","snapshot_observed_at":"2026-08-10T22:20:59.211695Z","title":"Graph attention networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.211695Z"},"links":{"cited_paper":"/paper/1710.10903","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:c2b084d1e8428dba7e60da05b49fd08ae7c5887e34bcc3026ba3c2cbdf1b7ce2","observation_id":"7e7b17ad-ad80-418d-8ba4-b88d7e979228","resolution":{"observed_at":"2026-08-10T22:20:59.211695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:02.009770Z","title":"Adaptive message quan- tization and parallelization for distributed full-graph gnn training","venue":null,"work_id":"91563535-837e-4bad-8385-a63f4bf686ec","year":2023},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.225730Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:1f51a898ca990e52ef8eb8fe3a51376849422ccc5a6ce7f6d52d40c3dbcda70a","observation_id":"a770c2b6-0991-470a-9da3-cf781b35cc45","resolution":{"observed_at":"2026-08-10T22:21:02.016523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.961795Z","title":"BNS- GCN: Efficient full-graph training of graph convolutional networks with partition-parallelism and random boundary node sampling","venue":null,"work_id":"7317a43c-78ba-4ca9-acae-5a4d315efd3a","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.236611Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:89e6d77dd953430e6aec43e4658e1a7b924ff5eb1f3286524626050b16bb51dd","observation_id":"f98be4b5-ff80-4c04-8aea-3ea9058a0a02","resolution":{"observed_at":"2026-08-10T22:21:01.978340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.920412Z","title":"Wolfe, Anastasios Kyrillidis, Nam Sung Kim, and Yingyan Lin","venue":null,"work_id":"6130fd57-7933-44c1-b91b-ac84cef671ea","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.251968Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:4c25a654ff3b5965388760111d325dc883254d80ec8b4f254fa65c6d51f7d97a","observation_id":"4587520d-d135-4149-b62d-8d95c9b56882","resolution":{"observed_at":"2026-08-10T22:21:01.933270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01040","last_updated":"2024-01-02T05:00:54Z","snapshot_observed_at":"2026-08-13T04:50:17.356801Z","submitted_at":"2024-01-02T05:00:54Z","title":"Towards Cognitive AI Systems: a Survey and Prospective on Neuro-Symbolic AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01040","snapshot_observed_at":"2026-08-10T22:20:59.261699Z","title":"Towards cognitive ai systems: a survey and prospective on neuro-symbolic ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.261699Z"},"links":{"cited_paper":"/paper/2401.01040","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:9caafa094a3d5a956fe094279ac86e31e5907f9a2a819286db5b8af26461b4d7","observation_id":"1267dc0d-981c-4a75-82f6-b9fe313081cb","resolution":{"observed_at":"2026-08-10T22:20:59.261699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.880415Z","title":"Flexgraph: a flexible and efficient distributed framework for gnn training","venue":null,"work_id":"055efc7e-67f8-4b1e-b785-2c912c964041","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.271511Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:5e0872b19285f6adb0e66ac87673975f18fdb8bc96885ee85b9c8a9a4ce9913e","observation_id":"835b8b77-41cd-4add-90f8-b678680feab1","resolution":{"observed_at":"2026-08-10T22:21:01.890633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.845620Z","title":"Supporting very large models using automatic dataflow graph partitioning","venue":null,"work_id":"43814238-ecf2-4969-a2d5-4ea181209041","year":2019},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.278477Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:4cfa0006dad9b309dcc13f1e2ca6c9301142259f78b9ed992f33c46876f5d712","observation_id":"ca78c1c0-447d-4f2a-820c-5460288bee04","resolution":{"observed_at":"2026-08-10T22:21:01.856788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01315","last_updated":"2020-08-25T15:46:13Z","snapshot_observed_at":"2026-07-06T08:18:46.549511Z","submitted_at":"2019-09-03T17:10:28Z","title":"Deep Graph Library: A Graph-Centric, Highly-Performant Package for Graph Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01315","snapshot_observed_at":"2026-08-10T22:20:59.290357Z","title":"Deep graph library: A graph-centric, highly-performant package for graph neural networks","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.290357Z"},"links":{"cited_paper":"/paper/1909.01315","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:657ebbbe2ed0f7b117da12d7691b8e3885a84fb0ed483a91a656ff10d1326416","observation_id":"5d290b2d-c270-4682-a6fe-5bba44dd1631","resolution":{"observed_at":"2026-08-10T22:20:59.290357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.779268Z","title":"Neutronstar: distributed gnn training with hybrid dependency management","venue":null,"work_id":"fbbb5920-263a-44c5-87ce-f039c7212da6","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.298190Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:84ec8a5fda9918a778fe5eedf93009dc6f1612f8e10958bdb0b9ad7af36b918f","observation_id":"9362a877-359f-4af1-817d-259a0283cdaa","resolution":{"observed_at":"2026-08-10T22:21:01.824164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.06608","last_updated":"2021-06-20T04:49:17Z","snapshot_observed_at":"2026-08-13T18:03:43.161647Z","submitted_at":"2020-06-11T16:58:10Z","title":"GNNAdvisor: An Adaptive and Efficient Runtime System for GNN Acceleration on GPUs","version":3},"cited_work":{"arxiv_id":"2006.06608","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.06608","snapshot_observed_at":"2026-08-10T22:21:00.110301Z","title":"GNNAdvisor: An Adaptive and Efficient Runtime System for GNN Acceleration on GPUs","venue":"cs.DC","work_id":"b3ed07d2-8cae-4c66-9bbc-9d84ab79a2b1","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.304951Z"},"links":{"cited_paper":"/paper/2006.06608","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:0ed89bb0d1566f9fc62a32c2dc9e5e86c22407908ac2e1336f93a6dcf3be33c2","observation_id":"6da99ef0-b5b7-497b-981c-529d4695541d","resolution":{"observed_at":"2026-08-10T22:21:00.130736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.735498Z","title":"how graph neural networks go beyond weisfeiler-lehman?","venue":null,"work_id":"d2718b4a-cd2e-4072-85b5-c2e068a6a34b","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.315146Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:80b50cd04a3dfc8b9d69b615be462935b55f077d8537ec59849c41d451578fd0","observation_id":"04ef5575-beb6-448a-97d3-5e090e4976d7","resolution":{"observed_at":"2026-08-10T22:21:01.748058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.713683Z","title":"A comprehensive survey on graph neural networks","venue":null,"work_id":"0624e079-5e7a-4f5d-8e0d-86ad8b2910b5","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.322158Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:1a35830027af266519b814e568097e6b16028da804568055013b7026259ac1de","observation_id":"58b0993f-a610-4bad-bfd2-354f248a1864","resolution":{"observed_at":"2026-08-10T22:21:01.719851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.676024Z","title":"Graph learning: A survey","venue":null,"work_id":"16d55b23-d3a9-4c3d-a84a-7c87ff6fe09d","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.328289Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:2c3f3354cb247c690d6f71d9d090aa5e2c959741f70e731aa395cc158df89be5","observation_id":"211a737e-8cfb-4d27-babd-abbddde3e4ca","resolution":{"observed_at":"2026-08-10T22:21:01.683972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00826","last_updated":"2019-02-22T19:15:54Z","snapshot_observed_at":"2026-08-13T05:06:48.606308Z","submitted_at":"2018-10-01T17:11:31Z","title":"How Powerful are Graph Neural Networks?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.00826","snapshot_observed_at":"2026-08-10T22:20:59.341765Z","title":"How powerful are graph neural networks? arXiv preprint arXiv:1810.00826, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.341765Z"},"links":{"cited_paper":"/paper/1810.00826","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:474b60646cc8d6ec7ee4a1acdae103c61b72b45011bd345dffa35d73d8c1473e","observation_id":"5ae5805c-cbec-452a-9a1d-dfdc7f84c6b4","resolution":{"observed_at":"2026-08-10T22:20:59.341765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04663","last_updated":"2021-12-23T21:29:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-10T20:54:58Z","title":"GSPMD: General and Scalable Parallelization for ML Computation Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04663","snapshot_observed_at":"2026-08-10T22:20:59.348880Z","title":"Gspmd: general and scalable parallelization for ml computation graphs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.348880Z"},"links":{"cited_paper":"/paper/2105.04663","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:88752e1ba10bd98f170b7d8891292406046519e50a2693cbe2cebb10eef9aaae","observation_id":"6f0b339d-f9ca-4afb-8fa3-9d4f07837ae4","resolution":{"observed_at":"2026-08-10T22:20:59.348880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.628992Z","title":"Hygcn: A gcn accelerator with hybrid architecture","venue":null,"work_id":"69eeb662-d13b-4c06-bafc-917a2a7ec87f","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.354654Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:40fefb8f123666cb3df4f3d5d05521ab88493253b4f359921262b7779046ad51","observation_id":"1ae6a74e-3cab-4faa-bee7-24148c9f0f42","resolution":{"observed_at":"2026-08-10T22:21:01.640331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.602316Z","title":"Defining and evaluating network com- munities based on ground-truth","venue":null,"work_id":"b1928cac-dbc9-4edf-9f13-c252b0e3a2e2","year":2012},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.365045Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:eed5710f13f3a9949629477f5a80fb4ce998d0e113d8eb41dca1972443922838","observation_id":"1676b62e-3f12-4397-8fe0-94122f328542","resolution":{"observed_at":"2026-08-10T22:21:01.609457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.578323Z","title":"Optimal all-to-all personalized exchange in self-routable multistage networks","venue":null,"work_id":"f1e27520-a76d-4094-9d73-d293be2cd58b","year":2000},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.373416Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:8e47d511b72e15d49bfed3b19d83d56a9868850478f7c0e739c82e57b587c79e","observation_id":"b7be38e9-e0d2-4528-a1cd-512d6665a03c","resolution":{"observed_at":"2026-08-10T22:21:01.585646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.557532Z","title":"Graph convolutional neural networks for web-scale recommender systems","venue":null,"work_id":"423882d6-856d-444d-a497-2be218b72eb0","year":2018},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.380014Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:56bdc3580e734e34b560de7c3fffb9babf127569d17eda01b3414a0e91c0a87c","observation_id":"36f83b9b-087d-4ade-a8c3-8a79ad3ff20a","resolution":{"observed_at":"2026-08-10T22:21:01.563709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11594","last_updated":"2025-03-09T02:58:24Z","snapshot_observed_at":"2026-08-13T17:10:26.337571Z","submitted_at":"2021-12-22T00:30:50Z","title":"GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design","version":3},"cited_work":{"arxiv_id":"2112.11594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.11594","snapshot_observed_at":"2026-08-10T22:20:59.925146Z","title":"GCoD: Graph Convolutional Network Acceleration via Dedicated Algorithm and Accelerator Co-Design","venue":"cs.AR","work_id":"25ff0a8d-23c0-4877-86b6-f8f075ca2237","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.388936Z"},"links":{"cited_paper":"/paper/2112.11594","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:a9a8e41ac3e864e3d8b87d43168dbcfd3239f8cbb1c491cf3f960700e3189e1e","observation_id":"5761de6c-1f3a-4b74-9879-388143157dc2","resolution":{"observed_at":"2026-08-10T22:20:59.949902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.511107Z","title":"Graphact: Accelerating gcn training on cpu-fpga heterogeneous platforms","venue":null,"work_id":"fdaf53ad-50ee-42f8-82e6-e6406e78e078","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.402570Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:1d30715c8aef42cb6fdd11a7b694fe567b7953bcd4d77886195a9871f60ecd0f","observation_id":"043d9979-41bb-4e62-8ef3-754470da660e","resolution":{"observed_at":"2026-08-10T22:21:01.517837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.467530Z","title":"Hardware accel- eration of large scale gcn inference","venue":null,"work_id":"15ea97f3-dae7-4eb1-b098-875b6c103f1d","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.412065Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:b3728a68c69209dd49450d0d76084af47fe24ea5906d73c8ba11872f6a4b5105","observation_id":"f71bf75c-46be-4796-9987-846e59d84a8e","resolution":{"observed_at":"2026-08-10T22:21:01.480358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.407132Z","title":"Autosync: Learning to synchronize for data-parallel distributed deep learning","venue":null,"work_id":"0be8dc7c-f7c9-473e-8fea-5cbfeed3f65b","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.421597Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:163f7a60fba37b7171a53e748c5edbd91edee4ec682c1c5101a9c7af257378d7","observation_id":"d8bdd40a-449d-4617-b1fa-407f42a8deb7","resolution":{"observed_at":"2026-08-10T22:21:01.414892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.372997Z","title":"Understanding gnn computational graph: A coordinated computation, io, and memory perspective","venue":null,"work_id":"aefe31c6-fbc4-45f6-96dc-0257aa43243b","year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.428702Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:cc81a3d7e41500b83d22ab97eec14ff5e0c458f5732a5a8c44fc836edcc3ef66","observation_id":"226251fb-c1b5-4d19-af6c-c9f5c1cb842f","resolution":{"observed_at":"2026-08-10T22:21:01.380663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.325187Z","title":"Sylvie: 3d-adaptive and universal system for large-scale graph neural network training","venue":null,"work_id":"d1d0b5d9-14d5-46fa-bb86-d2d18e7c7acb","year":2024},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.444800Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:c278f7fc4bec8f55d72a668c36bdb947397b190fdca1a04626ea62befb161f31","observation_id":"eef5f213-4459-43c6-8fcf-05e22b254284","resolution":{"observed_at":"2026-08-10T22:21:01.337455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:20:59.466573Z","title":"A survey on graph neural network acceleration: Algorithms, systems, and customized hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.466573Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:0be8289782000317f16813a653c46856fb653f8d44a00219984ce72a0de799a1","observation_id":"074e3a38-5b1f-415a-87f7-6211cd42e502","resolution":{"observed_at":"2026-08-10T22:20:59.466573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.290164Z","title":"G-cos: Gnn-accelerator co-search towards both better accuracy and efficiency","venue":null,"work_id":"7509e22b-23b3-4da2-a286-7fc69a917fac","year":2021},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.474260Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:a6e1c3e01b061931b5edf136c9a37eea37c1001c73f4faccfa63eda7f6afb722","observation_id":"0017fa5e-48dd-41b9-893c-814409a72f4b","resolution":{"observed_at":"2026-08-10T22:21:01.295822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-10T22:20:59.490966Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.490966Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:76b356f5f875ca7a20b7e774135fd73696437435e63e53af1bedf622b9223c20","observation_id":"354e0a3f-1189-409a-8e77-fc09bf6937e8","resolution":{"observed_at":"2026-08-10T22:20:59.490966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:21:01.263377Z","title":"Distdgl: dis- tributed graph neural network training for billion-scale graphs","venue":null,"work_id":"a8753e15-d963-4c35-aa7e-8ef2417032ab","year":2020},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.498436Z"},"links":{"citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:d9381d2b5edd2c5aa4cafe2d900475281260848e679ab3e18ad4fb5b81092b0f","observation_id":"cfbc0ac6-f3d0-4db7-bab7-145e04795291","resolution":{"observed_at":"2026-08-10T22:21:01.278205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12023","last_updated":"2022-06-28T19:36:44Z","snapshot_observed_at":"2026-08-13T16:51:11.685030Z","submitted_at":"2022-01-28T10:13:35Z","title":"Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12023","snapshot_observed_at":"2026-08-10T22:20:59.515950Z","title":"Alpa: Automating inter-and intra- operator parallelism for distributed deep learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.515950Z"},"links":{"cited_paper":"/paper/2201.12023","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:326d7362dddd4da6402e6342fe2d2cc551a0b8c3ceb2a8567c5a7cb1de3f730d","observation_id":"29e2cab1-2fc9-4a87-ad2f-824e7f23e79e","resolution":{"observed_at":"2026-08-10T22:20:59.515950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08730","last_updated":"2019-02-23T03:45:31Z","snapshot_observed_at":"2026-07-06T07:34:54.202142Z","submitted_at":"2019-02-23T03:45:31Z","title":"AliGraph: A Comprehensive Graph Neural Network Platform","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.08730","snapshot_observed_at":"2026-08-10T22:20:59.524307Z","title":"Aligraph: A comprehensive graph neural network platform","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T22:20:59.524307Z"},"links":{"cited_paper":"/paper/1902.08730","citing_paper":"/paper/2501.01951"},"observation_digest":"sha256:6d55746fa2dded86a11e4e8fef99354e10c33dc6b067eaf7ecf5dc8c1fba052f","observation_id":"4e0e9db2-931a-4e59-b5a0-117a1f9dcac7","resolution":{"observed_at":"2026-08-10T22:20:59.524307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01951","last_updated":"2025-02-24T22:02:47Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T09:03:37.320781Z","submitted_at":"2025-01-03T18:54:46Z","title":"MixGCN: Scalable GCN Training by Mixture of Parallelism and Mixture of Accelerators"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":7,"verified_fuzzy":48},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 0 inbound Pith citation observations for arXiv:2501.01951."}