{"as_of":"2026-08-21T02:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3bab059718adf36fc5b032ba0e10ed46d56b721d3a86d28cd37f15440a5d2f7","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:44:53.606732Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15216/citation-record","integrity":"/paper/2507.15216/integrity","json":"/paper/2507.15216/citation-record.json","paper":"/paper/2507.15216"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.486881Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.486881Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:3b1f34bfbe2663480da2d93dfba14d4e1788f667de15783b9c6de1898c5e9e22","observation_id":"b6956d4b-4807-49b9-85bc-fe79770f7582","resolution":{"observed_at":"2026-08-06T15:44:53.486881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.957212Z","title":"A cookbook of self-supervised learning, 2023","venue":null,"work_id":"242db626-52a5-4592-a2b5-65cc80404a57","year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.489804Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:d2cc04a99d65545cdb4e0f5916ff64c1a7fb31adcb6ed7c0952ccd08682de6a1","observation_id":"2a19654d-33ef-4d92-b49e-b803d7715d69","resolution":{"observed_at":"2026-08-06T15:44:53.959683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12152","last_updated":"2023-03-25T13:01:42Z","snapshot_observed_at":"2026-08-20T01:20:05.151467Z","submitted_at":"2022-09-25T05:21:59Z","title":"All are Worth Words: A ViT Backbone for Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.12152","snapshot_observed_at":"2026-08-06T15:44:53.492073Z","title":"All are worth words: a vit backbone for score-based diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.492073Z"},"links":{"cited_paper":"/paper/2209.12152","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:4bdfe2f324e788d25391a85f776b637ec4b5d02bb0d5db7d7706cbe9ef0d1ee6","observation_id":"2064eb82-2671-4e20-8ed9-532491679207","resolution":{"observed_at":"2026-08-06T15:44:53.492073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-17T05:59:48.347864Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-06T15:44:53.494845Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.494845Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:89fe6813a66743e640c1f3c081e2cad85b9ce4deda5dee30ad1d28c4d5768897","observation_id":"f5998b31-bc20-4d43-9294-050980f571ae","resolution":{"observed_at":"2026-08-06T15:44:53.494845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.950238Z","title":"Stochastic positional embeddings improve masked image modeling, 2024","venue":null,"work_id":"aa8b38d8-3eef-472e-9fea-7fc973899bf4","year":2024},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.497700Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:3ad3e21263dd887b321cc7813a2cd99c1a1d025ebc1a92b23e3f9b36774f1b96","observation_id":"28e63d23-40bb-4f14-afbb-9d82879502a3","resolution":{"observed_at":"2026-08-06T15:44:53.952752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.941972Z","title":"Unsuper- vised learning of visual features by contrasting cluster assignments, 2021","venue":null,"work_id":"ba3c7c91-0353-4616-88bd-299613ef83c1","year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.500482Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:938a0a5cc6b18b3b9c7855da9ee698c30c55f71dfb0e4237814302c37f53fc3f","observation_id":"0009c23f-d6bb-4fce-832f-30bcda13e495","resolution":{"observed_at":"2026-08-06T15:44:53.945662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.503482Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.503482Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:cda66fd8253000cd7b63048e563071f15ecce3be55df9b33f1064bea85f5222a","observation_id":"a37d9532-5aee-4739-8d1b-6ee235acd15d","resolution":{"observed_at":"2026-08-06T15:44:53.503482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.929649Z","title":"Big self- supervised models are strong semi-supervised learners","venue":null,"work_id":"f315cc62-d70f-462c-b8b9-7f4bd7bb78e7","year":2020},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.506157Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:fb6a5566af0f340853997eb0ed35fbfd28fd0f5892266ad61c860edba717ba40","observation_id":"13a359ed-b458-475b-a8d0-18791237fb6b","resolution":{"observed_at":"2026-08-06T15:44:53.932482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.508637Z","title":"Improved baselines with momentum contrastive learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.508637Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:cce1a9e37be9b2b8b26ff9913daced0c5058b893b690cb9a26a28a00af3b048a","observation_id":"15e0a08a-40e9-404c-a99b-60d70c8d6f73","resolution":{"observed_at":"2026-08-06T15:44:53.508637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.916862Z","title":"Context autoencoder for self-supervised representation learning, 2023","venue":null,"work_id":"215dfb52-a02e-4567-8936-4f7c14a64989","year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.510767Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:f4577e5510ba80aaf15a2d26551bc13818003bdf10e12ba4769d3d106c885896","observation_id":"1810b710-c4cd-4d26-91c7-66cc08512054","resolution":{"observed_at":"2026-08-06T15:44:53.919651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.908280Z","title":"Deconstructing denoising diffusion models for self-supervised learning, 2024","venue":null,"work_id":"74d35a37-4279-4e10-8af0-f3d8b94136d0","year":2024},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.513062Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:1649e8f00572be956f3b2b4c72e7782da4cd454871b9b71164662912c34f5504","observation_id":"93679f88-0a45-478f-bcc2-bd1f3f05dad9","resolution":{"observed_at":"2026-08-06T15:44:53.912032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T15:44:53.515189Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.515189Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:30ba5988d1a435c9132bbbaa4e837d0f52083bc2c50f276ff6da87db63bf2674","observation_id":"5455c5c5-137f-4fc6-be69-f8326d8cbcb2","resolution":{"observed_at":"2026-08-06T15:44:53.515189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.899682Z","title":"Hospedales","venue":null,"work_id":"72a9f778-2141-43f0-884b-12cb0ee19886","year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.517507Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:5d3be66d433b10fe53f226e19fe3abaa9b38ee637c7252c107a04777f4cff06a","observation_id":"eceaae9d-1dfa-483b-9484-4a91066d0269","resolution":{"observed_at":"2026-08-06T15:44:53.903075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14391","last_updated":"2025-04-10T07:50:15Z","snapshot_observed_at":"2026-08-20T11:12:19.487221Z","submitted_at":"2024-01-25T18:49:57Z","title":"Rethinking Patch Dependence for Masked Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14391","snapshot_observed_at":"2026-08-06T15:44:53.519797Z","title":"Rethinking patch dependence for masked autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.519797Z"},"links":{"cited_paper":"/paper/2401.14391","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:0c689c833fe4f234590939ec84562b41cbb0247a38d02be20d9ef30c26c70780","observation_id":"8118ede1-3ad3-4be1-ad4b-92a3576403cc","resolution":{"observed_at":"2026-08-06T15:44:53.519797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14389","last_updated":"2024-02-21T15:45:20Z","snapshot_observed_at":"2026-08-18T21:22:33.938641Z","submitted_at":"2023-03-25T07:47:21Z","title":"MDTv2: Masked Diffusion Transformer is a Strong Image Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14389","snapshot_observed_at":"2026-08-06T15:44:53.522159Z","title":"Masked diffusion transformer is a strong image synthesizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.522159Z"},"links":{"cited_paper":"/paper/2303.14389","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:e24a459c98b0803b22379906e00c7402dbc7c5edbfdf7f507b72957437df8cb5","observation_id":"c12c6ebb-442b-42a5-9324-23bc55832735","resolution":{"observed_at":"2026-08-06T15:44:53.522159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.524588Z","title":"Learning and leveraging world models in visual representation learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.524588Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:fbfdcee1a1c2bcf56595b33a673c7c103d438a8cf076b4293bb4f4f011d88c7e","observation_id":"c6b3ff39-1f35-42a4-81ef-52b0ce2e2db7","resolution":{"observed_at":"2026-08-06T15:44:53.524588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.887164Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"a4f64c17-b77b-4f86-9748-f3f106e1f7a0","year":2020},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.526610Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:05522fd470a533b30b565d4e1ee631525a38d537cb2034691a3606d3bb91edc7","observation_id":"09e64c1a-e0d7-4f39-b975-f0ce8616d6b4","resolution":{"observed_at":"2026-08-06T15:44:53.889883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.528941Z","title":"Momentum contrast for unsupervised visual representation learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.528941Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:5dc32b680bb1899749e4905acd0b3771a7090bd169b2e5ef82611ed0846c7e0a","observation_id":"883946a5-ae0e-4043-85c8-e5c45313aff4","resolution":{"observed_at":"2026-08-06T15:44:53.528941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.876635Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"7ee22cad-4b5d-4b59-b6a1-514899486093","year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.531226Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:f7a984935539e4a8358ddaa5586f7a73a47c309424974d216292a789c3cd57d5","observation_id":"59588847-1a01-4c36-9262-d40d5087756b","resolution":{"observed_at":"2026-08-06T15:44:53.879210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.533268Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.533268Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:106686169e0ec21bb65c0e022e6b1906df8273ca874bf5dfde35ef02eeb87665","observation_id":"4c0d0080-1906-429b-83a8-4bf76f7ec95c","resolution":{"observed_at":"2026-08-06T15:44:53.533268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.865999Z","title":"What to hide from your students: Attention-guided masked im- age modeling","venue":null,"work_id":"0478f6cf-a1ed-4034-a412-0e4e1d5c916f","year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.535506Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:3f1ecf94ad9407b7af769fffce5d4517e28d2336c36c8ae807ae6f6ef1f25db5","observation_id":"23f54528-d667-4372-894c-107529ea83ff","resolution":{"observed_at":"2026-08-06T15:44:53.868454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.858498Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":"e00e7381-439b-4b41-957f-09452b5f21af","year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.537529Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:f22f940175b761d79f0b123f0890f1c83a358247845b7128812efec84a3bed5e","observation_id":"e406fc27-d11d-4ae2-b61d-6859ee514153","resolution":{"observed_at":"2026-08-06T15:44:53.861124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.05527","last_updated":"2022-06-11T02:36:37Z","snapshot_observed_at":"2026-08-16T18:18:11.852447Z","submitted_at":"2021-06-10T06:30:16Z","title":"Soft Truncation: A Universal Training Technique of Score-based Diffusion Model for High Precision Score Estimation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.05527","snapshot_observed_at":"2026-08-06T15:44:53.539679Z","title":"Soft truncation: A universal training technique of score-based diffusion model for high precision score estimation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.539679Z"},"links":{"cited_paper":"/paper/2106.05527","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:17fc8db86c2448aa51482c3d0d446c04eb26a6fe169e364916f27a35135676d5","observation_id":"dafdff17-7048-4f63-b79f-bf1c3f84af1d","resolution":{"observed_at":"2026-08-06T15:44:53.539679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.851762Z","title":"Exploring the role of mean teachers in self-supervised masked auto-encoders, 2022","venue":null,"work_id":"7ed5ce4f-05fd-4715-b1b6-54d61f1ebb0f","year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.542161Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:82cd259f33d746c93d564e411a5d65a44f5ea7252f0f59c8038db4d93d5c57cc","observation_id":"068ce778-0ac5-47c8-bf37-64b67c83be81","resolution":{"observed_at":"2026-08-06T15:44:53.854193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.843818Z","title":"Dreamteacher: Pretraining image backbones with deep generative models","venue":null,"work_id":"1d1342ee-bc3b-442c-b128-7d0968dcee2d","year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.544161Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:c30f3817d87faa4e5b7656e246d030dadc55cede3e489a842d7c976370736ae3","observation_id":"a5a688fc-564c-4acc-9013-0c60c7563b76","resolution":{"observed_at":"2026-08-06T15:44:53.846132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.837023Z","title":"Metaug: Contrastive learning via meta feature augmentation, 2023","venue":null,"work_id":"2ce6bcfa-2478-4393-8147-9db401e18c41","year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.546150Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:35b1aa7f748e29f3aeafb20bad25676438b62ecb559215639f5dbf29f0c7ee9f","observation_id":"1a57cef0-099a-4609-9d7b-93fc70bf5785","resolution":{"observed_at":"2026-08-06T15:44:53.839665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.829989Z","title":"Training stacked denoising autoencoders for representation learning, 2021","venue":null,"work_id":"a9afbe43-35ec-48ee-9cb7-c5c986ee079e","year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.548192Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:306b8d039d1a16773a4dc768eaafbcc520cca6efa12c80319e1f5309ae308241","observation_id":"83a3fa88-d20d-4084-87ed-fc1e6b8fe79f","resolution":{"observed_at":"2026-08-06T15:44:53.832593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.821692Z","title":"Self-supervised learning: Generative or contrastive","venue":null,"work_id":"9af7cfc4-778d-4057-bbc6-0a76ac3c9dd0","year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.550069Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:ab6bf8eadb5d608c59780da746c41e33b7777aca468add73cd8e9e60ac65074b","observation_id":"006b1273-1dc6-4ac5-9418-c9efa5396dac","resolution":{"observed_at":"2026-08-06T15:44:53.824735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-08-20T13:49:06.053430Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-06T15:44:53.552086Z","title":"Latent consistency models: Synthesizing high-resolution images with few-step inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.552086Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:f84d5d45f716e6148ab05d514c3dee35588e51fd0e68df8fd0263a4efcb7f9e8","observation_id":"71998524-d7c0-4427-a345-1abf077ac815","resolution":{"observed_at":"2026-08-06T15:44:53.552086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.554354Z","title":"On distillation of guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.554354Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:640c3bb458f96b71149502c12df9a033421fcc381b171b0e5258f42bd2cdce1a","observation_id":"440d6e30-b9bc-4623-9c82-9c78f82f00af","resolution":{"observed_at":"2026-08-06T15:44:53.554354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.811035Z","title":"From points to functions: Infinite- dimensional representations in diffusion models, 2022","venue":null,"work_id":"4c77cac3-f2c6-4a42-af83-4934113b05a9","year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.556235Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:1c5038374903bd582b250733361d9f0d657a1a1ed24b679c56f0827378751ebb","observation_id":"6930c265-de32-4a71-b460-faf1d3409ce9","resolution":{"observed_at":"2026-08-06T15:44:53.813598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.558130Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.558130Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:51a518c5bda8bb6cef87dcbbc620337ab0758fcb24d0baeaf05e2341b9cc6623","observation_id":"6a5a2351-95e5-4fd3-90c8-6fcce70fe55b","resolution":{"observed_at":"2026-08-06T15:44:53.558130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.560573Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.560573Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:0fffaeadfa3e645fd43834841b459a0cbbed973c779db81323a7f8a69f760333","observation_id":"c57d12b5-78ec-4f57-8318-7a986ee173cb","resolution":{"observed_at":"2026-08-06T15:44:53.560573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.562664Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.562664Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:2205064e8f5fd35d872b379e14df77f309dae73c06575be411f5eee7a3c52cb4","observation_id":"11fe9e0a-1c7d-4f2b-9fbe-71241504676b","resolution":{"observed_at":"2026-08-06T15:44:53.562664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.564959Z","title":"Hierarchical text-conditional image generation with clip latents, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.564959Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:049ac977270db7e5c220617e573f28782fa44d656463a9d879ccd382179770ac","observation_id":"1125a497-a9cd-4f94-b49a-5b0ccfd697df","resolution":{"observed_at":"2026-08-06T15:44:53.564959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.567030Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.567030Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:46d51e843b7eb828133fc58a49753b7530ba6efb3e95e123bc67416e0c549963","observation_id":"ccbed150-f687-4d3c-9dc6-cee00394dea6","resolution":{"observed_at":"2026-08-06T15:44:53.567030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.784527Z","title":"Numerical treatment of stochastic differential equations","venue":null,"work_id":"e064f646-ee53-4952-816c-e8ca02854514","year":1982},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.570419Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:3beb97f69a08b0ce7f0c85b2b3e89511cf78ee99633c548d00ff797c21049191","observation_id":"79afeaa3-a1d0-4d11-856f-2d3b7788b9c9","resolution":{"observed_at":"2026-08-06T15:44:53.787227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-06T15:44:53.572636Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.572636Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:545a3b4e1b7548c6be7c09d482567dcc876f429ab2894ac6b8cc77fab1170c2e","observation_id":"a6d7aa16-8a7b-4040-9c47-ca102de1f375","resolution":{"observed_at":"2026-08-06T15:44:53.572636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T15:44:53.575274Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.575274Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:aa2af34fb421a8a8b9c5d140f8b13e2a697ecc6a75ceb44f15295986a985e6cf","observation_id":"1e5f8d3a-e5ac-45ee-9da5-ca1e16fb6b75","resolution":{"observed_at":"2026-08-06T15:44:53.575274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.777528Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":"55ea59f1-6f7f-4489-b64b-1faf32c7fa72","year":2019},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.577389Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:05589328bd893780e2893bbb76c7c1e103b56de9ba615deac29480c77c40bb3b","observation_id":"1bb9afe6-5c1e-42f5-b8e3-07bdb7eab872","resolution":{"observed_at":"2026-08-06T15:44:53.780087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T15:44:53.579941Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.579941Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:b25f267ffa78fd04a0b0db2c82937df0d298b6c9838d5ece876876c866cbe3ff","observation_id":"0f00526e-991e-4ac1-8eae-da557cfd8bb2","resolution":{"observed_at":"2026-08-06T15:44:53.579941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.770683Z","title":"Maximum likelihood training of score-based diffusion models","venue":null,"work_id":"e6a3e160-ac5f-496b-b335-0522e2469810","year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.582427Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:9144a8a07b3efdd931b6d014bb7bfeb35bb528cbd014a44cc7c578c8725c4cc6","observation_id":"d814f043-4876-4ee9-96dd-af68c26c44e1","resolution":{"observed_at":"2026-08-06T15:44:53.773141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.763220Z","title":"Siamese image modeling for self-supervised vision representation learning, 2022","venue":null,"work_id":"bcd7320d-8346-421c-92d5-007b4eaa3ce6","year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.584399Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:eb558b076c61ad2b92cee039c549e1ed37c7340e1da6a8e1a21d404e7c8ddde8","observation_id":"09b48508-3084-45f8-8f50-3a78cba7df8f","resolution":{"observed_at":"2026-08-06T15:44:53.766259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.756183Z","title":null,"venue":null,"work_id":"0b9f3150-fd04-4627-90f3-c76abaf7f4e6","year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.586378Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:926f9971385ec1a2dc37dedd83f7970788c949eff1a49ca7e5e4c9df068b524a","observation_id":"c98f246d-5220-4edf-9944-e5992320225e","resolution":{"observed_at":"2026-08-06T15:44:53.758664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.749745Z","title":"Masked feature prediction for self-supervised visual pre-training","venue":null,"work_id":"59d68148-cf62-4ff9-8943-d695157f737a","year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.588752Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:5c8aeb262eafd9d132d7386362a6dd3b1ec9f64f331d16d2e21f020dd0727873","observation_id":"ec51dd81-a2ec-4fe0-81b3-a1a2b170c209","resolution":{"observed_at":"2026-08-06T15:44:53.751999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03283","last_updated":"2023-04-06T17:59:56Z","snapshot_observed_at":"2026-08-16T15:42:11.495093Z","submitted_at":"2023-04-06T17:59:56Z","title":"Diffusion Models as Masked Autoencoders","version":1},"cited_work":{"arxiv_id":"2304.03283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.03283","snapshot_observed_at":"2026-08-06T15:44:53.661883Z","title":"Diffusion Models as Masked Autoencoders","venue":"cs.CV","work_id":"5c6f3367-d74a-4945-a9ef-7328b28af618","year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.590862Z"},"links":{"cited_paper":"/paper/2304.03283","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:661e26748b20fbf3a00f438b0731118bc6698a07f0be94f767d22b6e11c4ba70","observation_id":"4b75491b-f8b3-414f-beae-5033ddcd25c5","resolution":{"observed_at":"2026-08-06T15:44:53.666043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.742692Z","title":"Hallucination improves the performance of unsupervised visual representation learning, 2023","venue":null,"work_id":"90599c2b-33a9-4a8c-8d87-12279b900d07","year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.593243Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:2c68ee476b52636adf3a037f81e1b7021583a673e3831cb3062a1f90f0b03f2b","observation_id":"45e1f33d-49bf-4728-a426-2b16a07ea676","resolution":{"observed_at":"2026-08-06T15:44:53.745396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.736306Z","title":"Denoising diffusion autoencoders are unified self-supervised learners, 2023","venue":null,"work_id":"116a47dd-30f4-4d90-a8f7-a3438a04a93d","year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.595439Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:7931049ec4d0c7947707cfd3ae6038c6e41fafde8925704a486aa4d7cce2483a","observation_id":"ffac9774-75e0-488d-a58e-320abd714ec4","resolution":{"observed_at":"2026-08-06T15:44:53.738576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:44:53.729432Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"cb2efdd0-f916-4088-bdfe-4c3c3d24bb26","year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.597698Z"},"links":{"citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:7ffdaa2d5a27d788e77575aa0aab990847ca2beed22e6f228ab125ab8ed30f09","observation_id":"29a05637-f6bd-42f1-8d5b-4b4725c6029e","resolution":{"observed_at":"2026-08-06T15:44:53.731992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07791","last_updated":"2022-08-16T15:02:21Z","snapshot_observed_at":"2026-08-19T10:12:46.131785Z","submitted_at":"2022-08-16T15:02:21Z","title":"Your ViT is Secretly a Hybrid Discriminative-Generative Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07791","snapshot_observed_at":"2026-08-06T15:44:53.599644Z","title":"Your vit is secretly a hybrid discriminative-generative diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.599644Z"},"links":{"cited_paper":"/paper/2208.07791","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:951fe1f41636b92ff5325affd50a7e86c89cba73ca8a2a8ced6ba8df7ce7511a","observation_id":"51aaf2b8-c807-4cba-b657-6221beb3dfed","resolution":{"observed_at":"2026-08-06T15:44:53.599644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16567","last_updated":"2024-06-12T07:16:21Z","snapshot_observed_at":"2026-08-18T15:15:53.288792Z","submitted_at":"2023-11-28T07:14:41Z","title":"MobileDiffusion: Instant Text-to-Image Generation on Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16567","snapshot_observed_at":"2026-08-06T15:44:53.602283Z","title":"Mobilediffusion: Subsecond text-to-image generation on mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.602283Z"},"links":{"cited_paper":"/paper/2311.16567","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:8a4c7a8e01f730c37cf46b727256e822a714ddc804edb7e2b19817ef324bc37d","observation_id":"27eb47d6-c0c5-4c6a-9075-379b55a1b951","resolution":{"observed_at":"2026-08-06T15:44:53.602283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09305","last_updated":"2024-03-05T01:10:18Z","snapshot_observed_at":"2026-08-16T15:23:34.823593Z","submitted_at":"2023-06-15T17:38:48Z","title":"Fast Training of Diffusion Models with Masked Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09305","snapshot_observed_at":"2026-08-06T15:44:53.604445Z","title":"Fast training of diffusion models with masked transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.604445Z"},"links":{"cited_paper":"/paper/2306.09305","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:40a86a13a8f3d2c0b386cf236ca925754aea240cef65395a88ed3066a504f51e","observation_id":"1261d8e6-cabb-4627-a43f-00f83fb3e609","resolution":{"observed_at":"2026-08-06T15:44:53.604445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-06T15:44:53.606732Z","title":"ibot: Image bert pre-training with online tokenizer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:44:53.606732Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2507.15216"},"observation_digest":"sha256:2e2a14a0341421d2a04383df9e44db3a3caf6fcf81d773c826ae7c37db6996d3","observation_id":"1c410d63-ba17-413d-99ee-64c11bd99a5f","resolution":{"observed_at":"2026-08-06T15:44:53.606732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15216","last_updated":"2025-07-21T03:36:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T03:54:56.612442Z","submitted_at":"2025-07-21T03:36:58Z","title":"Improving Joint Embedding Predictive Architecture with Diffusion Noise"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2507.15216."}