{"as_of":"2026-08-22T06:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:458803cf472e8f436168bea8705dc3274287e8dfedeb66ee0429a165e0af814d","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:24:30.453824Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.14373/citation-record","integrity":"/paper/2506.14373/integrity","json":"/paper/2506.14373/citation-record.json","paper":"/paper/2506.14373"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:26.185465Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.185465Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:8f6a2e18ef8bd59c4d77495a7774ba983a095d54c0fba7dec515bfdc9f034d4b","observation_id":"9fc82712-be8b-4279-882b-ae724a91b7c6","resolution":{"observed_at":"2026-08-07T00:24:26.185465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:26.237674Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.237674Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:5f59a943fed777ba7a33b5eb9d472fa5e962b1b50d499f01756c3a12f8d64d9e","observation_id":"e57ea957-88f9-4c9f-90af-de864697285b","resolution":{"observed_at":"2026-08-07T00:24:26.237674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13967","last_updated":"2025-06-04T12:56:23Z","snapshot_observed_at":"2026-08-18T14:38:59.557403Z","submitted_at":"2025-02-19T18:59:44Z","title":"FlexTok: Resampling Images into 1D Token Sequences of Flexible Length","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13967","snapshot_observed_at":"2026-08-07T00:24:26.329146Z","title":"F., Amirloo, E., El-Nouby, A., Zamir, A., and Dehghan, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.329146Z"},"links":{"cited_paper":"/paper/2502.13967","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:1a043ee12dcc4c30d528b85ecaa3f41c7a233ed8181b8d5e2ec79f956c20d54f","observation_id":"ee908e99-44c8-463c-bd17-ecc8f4bba974","resolution":{"observed_at":"2026-08-07T00:24:26.329146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:34.003325Z","title":"Dreamweaver: Learning compositional world models from pixels","venue":null,"work_id":"ce314d6d-4169-482e-be90-3f62d6ca3dc5","year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.427819Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:f1758f20e47b5d528ec0828a0548c3b3d4c6bdd684e2c69404e43494e3e73251","observation_id":"95fbd1b8-7cac-4aa6-bbf3-2814406a9c7b","resolution":{"observed_at":"2026-08-07T00:24:34.007479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.992374Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language","venue":null,"work_id":"402dfd02-2311-4cfe-a9ca-fdb83cc0dabf","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.492154Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:a97a14969dfd6fd7688e417aa29e721a86a9b9c910b6eeca549b8c4b54192a9b","observation_id":"7069b2c3-693c-47ea-b1fe-ec4da229b72d","resolution":{"observed_at":"2026-08-07T00:24:33.995855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-17T05:59:48.347864Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-07T00:24:26.555325Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.555325Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:fd021f37b65d739d2b4098a513158f902e9991ccca7f0d252fa67c3a25879518","observation_id":"7da386d6-421f-44c2-9941-79ad399fe2b2","resolution":{"observed_at":"2026-08-07T00:24:26.555325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04906","last_updated":"2022-01-28T12:23:37Z","snapshot_observed_at":"2026-08-21T02:04:15.452338Z","submitted_at":"2021-05-11T09:53:21Z","title":"VICReg: Variance-Invariance-Covariance Regularization for Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04906","snapshot_observed_at":"2026-08-07T00:24:26.691304Z","title":"Vicreg: Variance-invariance-covariance regularization for self-supervised learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.691304Z"},"links":{"cited_paper":"/paper/2105.04906","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:f60603374b530fbde7b51e3ac08f14f23d1927019e1a5fcb36319b448662af9c","observation_id":"0f02d643-addc-4fe4-a12b-dd2f54dd7d74","resolution":{"observed_at":"2026-08-07T00:24:26.691304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.982212Z","title":"V-jepa: Latent video prediction for visual representation learning","venue":null,"work_id":"821e102b-5217-4c2d-a027-6fc0f14bda30","year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.798973Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:374f1530ea0268e2d1a76fb9e7533000d93253bcb4adab09b08aea4b35d2604a","observation_id":"973f931b-ce4b-44e8-96b0-3e4cec9f4f07","resolution":{"observed_at":"2026-08-07T00:24:33.985764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12698","last_updated":"2023-07-24T11:27:14Z","snapshot_observed_at":"2026-08-16T15:13:49.942722Z","submitted_at":"2023-07-24T11:27:14Z","title":"MC-JEPA: A Joint-Embedding Predictive Architecture for Self-Supervised Learning of Motion and Content Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12698","snapshot_observed_at":"2026-08-07T00:24:26.878798Z","title":"Mc-jepa: A joint-embedding predictive architecture for self-supervised learning of motion and content features","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.878798Z"},"links":{"cited_paper":"/paper/2307.12698","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:c34a7f7e8bf5bbbae683e4fa682fb1b11da7112738d4c8eba8d64b23e67fc7b0","observation_id":"5448e556-3d81-4967-9691-4fb64c98e64b","resolution":{"observed_at":"2026-08-07T00:24:26.878798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.971423Z","title":null,"venue":null,"work_id":"7e9ba97b-bfcd-4a53-9d27-40c9ee73f519","year":2019},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:26.960544Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:d2de416750b5f39dd9819a69e8b1bda8838b8bbd785a2b87549d029c3e7f16a0","observation_id":"732a1c8b-1897-45ab-9cbc-572725cad9f4","resolution":{"observed_at":"2026-08-07T00:24:33.975553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.087183Z","title":"Unsupervised learning of visual features by contrasting cluster assignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.087183Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:8159f9c1125a254642a75ca34821cd17d6b19e521e0e865ba3bb1a0db3dd625e","observation_id":"e1dd3558-7b46-4bd9-982c-4cc91e50f13a","resolution":{"observed_at":"2026-08-07T00:24:27.087183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.227869Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.227869Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:940b72fcc8b6178a63e47dd40321ec8b5860906ed2b2e01f70c960f905899c2a","observation_id":"7871b9f2-5379-45c5-a868-9ce7ff8dab8e","resolution":{"observed_at":"2026-08-07T00:24:27.227869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.320134Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.320134Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:f1921a1ced2ac87c4d73a81f952e3241b9d47e8e313a769bf0b55e0e4ef4239e","observation_id":"869ce1de-05c7-4f86-bb31-c3b5621ecd39","resolution":{"observed_at":"2026-08-07T00:24:27.320134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.937938Z","title":"Denoising with a joint-embedding predictive architecture","venue":null,"work_id":"f5a16452-dddd-49f6-be74-c09f0e83104b","year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.393067Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:f5d1e58e0091689998b70808e3c0daf88398bf05a5c877337c087efb6a6b63c7","observation_id":"970ba5bc-d4f8-44dc-8a9d-57e95e897a62","resolution":{"observed_at":"2026-08-07T00:24:33.941909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.883119Z","title":"Masked autoencoders are effective tokenizers for diffusion models","venue":null,"work_id":"57050fa5-a9bc-4583-bdcc-8b2bef492c87","year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.478920Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:1f6ac8fb55cbebb41b91ab1bacd03804e24dc5db980779ef4bdf1735fc49120c","observation_id":"814a123c-9385-4331-9f15-c49a022cb99b","resolution":{"observed_at":"2026-08-07T00:24:33.929950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.671057Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"88e148ee-8f2d-47c9-abb6-4a479604e7ae","year":2020},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.572690Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:e1662a714a541c35321c6994665f68a41568c60f1620cf2bd3cdc2eb2e9f8a23","observation_id":"4e342daa-260c-44e9-9c32-6d3b377521d8","resolution":{"observed_at":"2026-08-07T00:24:33.775735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:24:27.663546Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.663546Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:faae98fa19cc8442306656980b328c4656fc49cc47677d777868aa506647c837","observation_id":"797b6d33-8203-47ad-99bc-4d375504ee93","resolution":{"observed_at":"2026-08-07T00:24:27.663546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:27.763668Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.763668Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:337af3c6d6ffe4ecc86c2a185a7f3be3436f2cbc848e86d4831cc8cbb7eafae2","observation_id":"fda9560b-0e31-4ed5-b0ed-f4de325c639f","resolution":{"observed_at":"2026-08-07T00:24:27.763668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.376936Z","title":null,"venue":null,"work_id":"2a16e2ad-b1ce-4bc9-b0d6-61d7c72ab41b","year":2013},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.839664Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:e47387c92e7560b7a77fb56d245fa066c5648badce81e5cb94338e5f398b0eed","observation_id":"b0cc2f58-a326-43cd-b30e-84fecd860496","resolution":{"observed_at":"2026-08-07T00:24:33.508791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15830","last_updated":"2024-01-11T13:16:43Z","snapshot_observed_at":"2026-08-22T04:35:56.507945Z","submitted_at":"2023-11-27T13:53:53Z","title":"A-JEPA: Joint-Embedding Predictive Architecture Can Listen","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15830","snapshot_observed_at":"2026-08-07T00:24:27.926611Z","title":"A-jepa: Joint-embedding predictive architecture can listen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.926611Z"},"links":{"cited_paper":"/paper/2311.15830","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:a81cc7340d229c9b79aac48308cda498bdfe26e9e70dcf6985c626ea750a2bd7","observation_id":"00540c91-095e-4b7b-8827-d9f08fba4a75","resolution":{"observed_at":"2026-08-07T00:24:27.926611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:33.154895Z","title":"R., Blundell, C., Beaudoin, P., Heess, N., Mozer, M","venue":null,"work_id":"8d444864-ad13-44cc-9afd-5e351ebe3ccd","year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:27.970122Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:523eeb5e12db137403ca72e6c9d816fd2cc30962cb399e3ca0c406f01a3c2f08","observation_id":"3bc71edd-e1c8-48cf-bdca-f54608716322","resolution":{"observed_at":"2026-08-07T00:24:33.285288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:28.070454Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.070454Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:8a041905ebf1068eb4735a491a0579260fc75243b77dd2eaa5e9b017d6efc2e5","observation_id":"08e4475c-0384-4af4-86e4-73dbf9a9e974","resolution":{"observed_at":"2026-08-07T00:24:28.070454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:28.143370Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.143370Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:d536ebb6575cd5d79df61f3dfe83350600f22e9a68122bad1b0a60745a7e6b4f","observation_id":"61cec8d4-1ce4-48d4-9469-a914b6f753d0","resolution":{"observed_at":"2026-08-07T00:24:28.143370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:32.856012Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"d9a23cad-b16c-46df-b361-b65cfa3aca00","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.250270Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:4f03d572b83a2be596ad12277d1a864b60255bdb6df4ff3a6af9524d8f22da2c","observation_id":"d2ba66fa-fa82-4785-9768-6d26e32b2d41","resolution":{"observed_at":"2026-08-07T00:24:33.018490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:32.586981Z","title":"Slot state space models","venue":null,"work_id":"e5eef4dd-8235-4268-bb5b-eadcbe91013b","year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.401167Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:4568f13daddbf432dc00a4d519844e12a12c0138e3a0c56595b41d87441d8d51","observation_id":"9a676a67-ffc9-485f-b242-4b3ccf2bb6bd","resolution":{"observed_at":"2026-08-07T00:24:32.692226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:32.355348Z","title":"Thinking, fast and slow","venue":null,"work_id":"e6991340-8bf2-439a-8cbc-905c7a0d5fde","year":2011},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.499285Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:5340e095a25cf634d8941c56e2916cabb42d3db5512dcc98524c1db81f4191b6","observation_id":"2f9dff62-4992-4dc3-9889-0edbf6ebcdec","resolution":{"observed_at":"2026-08-07T00:24:32.465421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07730","last_updated":"2025-08-02T07:11:16Z","snapshot_observed_at":"2026-08-17T07:53:14.156204Z","submitted_at":"2025-01-13T22:37:17Z","title":"Democratizing Text-to-Image Masked Generative Models with Compact Text-Aware One-Dimensional Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07730","snapshot_observed_at":"2026-08-07T00:24:28.604884Z","title":"Democratizing text-to-image masked generative models with compact text-aware one-dimensional tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.604884Z"},"links":{"cited_paper":"/paper/2501.07730","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:b14745b5d67e8f435d48f01223885ee64fc27a36e9e0b381cf3817f5f72feb25","observation_id":"e68e0ac9-b8b6-4158-bd8f-a754fcb4aa74","resolution":{"observed_at":"2026-08-07T00:24:28.604884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:32.043022Z","title":"A path towards autonomous machine intelligence version 0.9","venue":null,"work_id":"909e842a-2cb6-4cbe-ad29-482459ca0d04","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.762881Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:4b2c73857b553f2b39d849a91d6b788f6a97ba479525ea89e5132d9e5f52bba4","observation_id":"3d73cb7f-299a-4e5b-b4d4-db1229f2358a","resolution":{"observed_at":"2026-08-07T00:24:32.146526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.903717Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"d4ca2ca4-1613-4d2f-a47a-9e6e954ecd1e","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.874789Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:a06bca003ba09a23911e0782e9d9fd095abd49817149feca4f5e46ac1020c226","observation_id":"7e781f09-f75a-472e-a28a-00edc0b4d445","resolution":{"observed_at":"2026-08-07T00:24:31.956028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-08-21T21:54:53.523676Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-07T00:24:28.960511Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:28.960511Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:f7dbabb450aea550fb7b8c0d4032e203f55160b214987d0264a6a4b01f2a49af","observation_id":"8ccd5c0d-d428-4790-84e5-a70538717b2c","resolution":{"observed_at":"2026-08-07T00:24:28.960511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.674806Z","title":null,"venue":null,"work_id":"16c0becf-f8de-4232-9f67-5fa18157ace9","year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.045870Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:77c86fbec2e40870583972a82254ea4fd412027b41c07431b1d8b706ba0f457a","observation_id":"41008482-6f2f-4304-af53-592caea5d1ff","resolution":{"observed_at":"2026-08-07T00:24:31.757430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.536578Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"6b0582a9-5d12-4b7c-a810-61677956efd0","year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.146927Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:979a476063f4ef210551e418b50c8fb7b4b69be92b2a5569d96afa62670957e0","observation_id":"5e3d6c9e-7bc1-4190-a1e8-d1af6e3499a7","resolution":{"observed_at":"2026-08-07T00:24:31.604603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.248985Z","title":"Generating diverse high-fidelity images with vq-vae-2","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.248985Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:21674ebaea9a640790568165b8bd333b895b303218a4d3c7538dde07c7ef90e3","observation_id":"55338ea2-0bd6-481b-b711-77c34cfd078d","resolution":{"observed_at":"2026-08-07T00:24:29.248985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12690","last_updated":"2024-05-10T09:54:46Z","snapshot_observed_at":"2026-08-16T14:50:44.744675Z","submitted_at":"2023-10-19T12:38:09Z","title":"Neurosymbolic Grounding for Compositional World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12690","snapshot_observed_at":"2026-08-07T00:24:29.359281Z","title":"J., and Chaudhuri, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.359281Z"},"links":{"cited_paper":"/paper/2310.12690","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:7fbbed483ab06cea9a99f70ca06f5113cac3f031dc4f1a253050530512d6f9bf","observation_id":"8b01dca9-4494-4488-be5c-3f2f370f5fb1","resolution":{"observed_at":"2026-08-07T00:24:29.359281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10831","last_updated":"2022-11-20T00:50:11Z","snapshot_observed_at":"2026-08-21T04:04:42.184933Z","submitted_at":"2022-11-20T00:50:11Z","title":"Joint Embedding Predictive Architectures Focus on Slow Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10831","snapshot_observed_at":"2026-08-07T00:24:29.442876Z","title":"Joint embedding predictive architectures focus on slow features","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.442876Z"},"links":{"cited_paper":"/paper/2211.10831","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:a52bd216d4dae56ee31997baa0892c5b94f13d024b6982361e738ba53a1d62e8","observation_id":"843b2738-6ce8-4e95-a3f8-14f69bb196db","resolution":{"observed_at":"2026-08-07T00:24:29.442876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07547","last_updated":"2022-06-09T12:46:05Z","snapshot_observed_at":"2026-08-16T17:00:05.954109Z","submitted_at":"2022-05-16T09:49:37Z","title":"SQ-VAE: Variational Bayes on Discrete Representation with Self-annealed Stochastic Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07547","snapshot_observed_at":"2026-08-07T00:24:29.539556Z","title":"Sq-vae: Variational bayes on discrete representation with self-annealed stochastic quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.539556Z"},"links":{"cited_paper":"/paper/2205.07547","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:fe0a98deecba58c4505377343bf2a6e9831d8fe4ca93489425a5ab0ebfae15c4","observation_id":"e2880a72-e37b-453e-a927-c5c302388e09","resolution":{"observed_at":"2026-08-07T00:24:29.539556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.651416Z","title":"Worldcoder, a model-based llm agent: Building world models by writing code and interacting with the environment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.651416Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:fa598c038370d0041a3987d90686742d6e97d1f46c044593be341873e2ad1e45","observation_id":"d6f5fe50-fa18-43c0-be2a-d29adcd1bdf7","resolution":{"observed_at":"2026-08-07T00:24:29.651416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.380567Z","title":"and Levy, M","venue":null,"work_id":"0bb97900-baf8-4878-ac92-f3b6e3ce6d22","year":2019},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.724101Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:8bc471e82c1a25ee6afc7c6e83fd0ac18866198934e7f03045fcc5d89e3bc5c0","observation_id":"afa3f788-8206-42af-8017-d1fabb6caf6a","resolution":{"observed_at":"2026-08-07T00:24:31.447266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:29.801294Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.801294Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:d3546722318ee615dd5fea78d025218cea1c49d9c5f1828143c853842cae39ea","observation_id":"4ed3b26e-65ec-436d-b75f-b7ea70d3e500","resolution":{"observed_at":"2026-08-07T00:24:29.801294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:31.178299Z","title":"LARP : Tokenizing videos with a learned autoregressive generative prior","venue":null,"work_id":"97da56fa-d4cb-4f82-aa72-d830e144120c","year":2025},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.878149Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:b4f83d4e6e82861adfbb2bd3f47da87016a91d315aa979dc8a537c2e045c8586","observation_id":"39fa1c7b-eed5-45d6-a9c7-6f4389ea56c5","resolution":{"observed_at":"2026-08-07T00:24:31.292857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.996968Z","title":"Spriteworld: A flexible, configurable reinforcement learning environment","venue":null,"work_id":"aa377a6e-f2f3-4759-baeb-9144743a6520","year":2019},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:29.947822Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:48ed87d0e760ac6f2d985121bfa685b124006f9cd4ab0009f0d2e1755993013f","observation_id":"dee467ee-a23f-4e91-85af-fc2a84316696","resolution":{"observed_at":"2026-08-07T00:24:31.074167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05127","last_updated":"2025-02-26T02:55:53Z","snapshot_observed_at":"2026-08-19T05:16:18.450429Z","submitted_at":"2024-06-07T17:55:43Z","title":"Towards Semantic Equivalence of Tokenization in Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05127","snapshot_observed_at":"2026-08-07T00:24:30.005895Z","title":"Towards semantic equivalence of tokenization in multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.005895Z"},"links":{"cited_paper":"/paper/2406.05127","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:730139d10f54b1d48fd633755d2490ea8012d6401ac1be3f7c13f1eb86d41c41","observation_id":"4af2eb45-a61b-43b3-89fb-ba0ebb81fea4","resolution":{"observed_at":"2026-08-07T00:24:30.005895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.096531Z","title":"Temporally consistent transformers for video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.096531Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:e76863a9e947a44f7b84a721f0259d4b37639d4643234d0cc04fd849179149b9","observation_id":"a426e9c4-71c3-4afb-a169-693f1fa86fb5","resolution":{"observed_at":"2026-08-07T00:24:30.096531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-08-21T12:42:02.651994Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T00:24:30.154979Z","title":"Y., Zhang, H., Pang, R., Qin, J., Ku, A., Xu, Y., Baldridge, J., and Wu, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.154979Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:6850359bf894c475512ac99f1a40251cd322859f3b4e8a615a6dfa69d2727173","observation_id":"c4b8d77e-2d40-4634-9e99-c9e758dae6fd","resolution":{"observed_at":"2026-08-07T00:24:30.154979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.839826Z","title":"G., Yang, M.-H., Hao, Y., Essa, I., et al","venue":null,"work_id":"0631ef23-f3d5-414c-920f-5ea7e293138e","year":2023},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.250765Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:b1a0001a7f09fa71172922951d359fed79c6d82ca6117284357ebecf610203ba","observation_id":"ffb2c71a-d367-46f6-976a-014c9fc63ce1","resolution":{"observed_at":"2026-08-07T00:24:30.921708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.337622Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.337622Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:ca6ef937700c746dcce583949b2e30cc83eb6e76393bd42f9faf471a98cf52a6","observation_id":"314029b8-d81a-4696-bd4a-124ff8757640","resolution":{"observed_at":"2026-08-07T00:24:30.337622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:24:30.676689Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":"acee7c8d-18f6-41da-878a-4d9703d718df","year":2022},"citing_paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:30.453824Z"},"links":{"citing_paper":"/paper/2506.14373"},"observation_digest":"sha256:2dd2700bbfe3d277575bb47e137064a79fd178e9790347c7cd645d4b9acb391c","observation_id":"5c8ddd92-360a-4c9e-9e87-a5c79cc23ca0","resolution":{"observed_at":"2026-08-07T00:24:30.751457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.14373","last_updated":"2025-06-22T15:49:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T10:02:52.949197Z","submitted_at":"2025-06-17T10:15:17Z","title":"Discrete JEPA: Learning Discrete Token Representations without Reconstruction"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2506.14373."}