{"as_of":"2026-08-17T00:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b21c5f73019e34eee64512e814425ae9ebdf27a8a33214983d7af5e4155031d","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:02:14.488862Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03005/citation-record","integrity":"/paper/2501.03005/integrity","json":"/paper/2501.03005/citation-record.json","paper":"/paper/2501.03005"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.01499","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.833791Z","title":"Assran, Q","venue":null,"work_id":"6b56a264-fb64-47b8-8119-275c5b46e378","year":2023},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.392369Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:6f66a896cc4516e35c630cf64e8f3fbb571ea708f9d319531583272a2796ea69","observation_id":"83549198-8119-4e0a-abac-dbd258ebaeaa","resolution":{"observed_at":"2026-08-10T22:02:14.840785Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.959725Z","title":"Baevski, W","venue":null,"work_id":"740330a0-a69e-4d15-804a-35d8cc23c352","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.396551Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:39a6565ba450e5b73997f128d4755ca41096a0102299593ecb6865f0c7b45ed1","observation_id":"900b4b94-3f98-41c3-a473-967e6b9ef316","resolution":{"observed_at":"2026-08-10T22:02:14.963403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.948901Z","title":null,"venue":null,"work_id":"02a1d8b4-f7da-4d98-ab51-52fc8f44dc6f","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.400415Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:4114251d33bd7a29da875ee189e5ae4ed69b97dfaea49a0c7ad814b7d694475d","observation_id":"6e3f718b-8500-4da9-8de4-466b243e69f6","resolution":{"observed_at":"2026-08-10T22:02:14.952371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.938536Z","title":"Caron, H","venue":null,"work_id":"2306bda3-cfe1-4f0d-96dc-afcb2781c32e","year":2021},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.404394Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:4d1cd6f1cf3c1adb9eb0f221e99c7e4b70fcb2f4e34e5431c23516710812c57d","observation_id":"9ad125df-8860-4e6d-960d-e5991165e1d6","resolution":{"observed_at":"2026-08-10T22:02:14.942122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03026","last_updated":"2023-08-10T11:01:14Z","snapshot_observed_at":"2026-08-16T17:23:11.785033Z","submitted_at":"2022-02-07T09:33:45Z","title":"Context Autoencoder for Self-Supervised Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03026","snapshot_observed_at":"2026-08-10T22:02:14.411704Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.411704Z"},"links":{"cited_paper":"/paper/2202.03026","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:beff957fbeb1ca79c7ee867805a3b2b8913928a22f1948fb4376a4b0c91d8331","observation_id":"3455d2a0-20bf-4fc7-84e5-f756fab256d6","resolution":{"observed_at":"2026-08-10T22:02:14.411704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.928489Z","title":null,"venue":null,"work_id":"4ee08e1b-058a-4f1c-a89b-60bf96d94558","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.415961Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:63559897ef37379d94e98c281779dd71221d6bffc4c395713a01d53e603df597","observation_id":"64f8a781-55d2-4a7f-8b4f-84c5d24b13d7","resolution":{"observed_at":"2026-08-10T22:02:14.931995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.918211Z","title":"Dosovitskiy, L","venue":null,"work_id":"acffe7d0-f0bc-42a7-bf27-f156eeb258c0","year":2021},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.419799Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:d9fa5bfdf8cbdf55fe93997de196dd7f5532232c6cd3811d88a6fd98b0d0097a","observation_id":"c738b8e9-73e4-4d01-9093-e859b11ae957","resolution":{"observed_at":"2026-08-10T22:02:14.921687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03892","last_updated":"2022-05-19T16:28:37Z","snapshot_observed_at":"2026-08-16T17:01:48.716400Z","submitted_at":"2022-05-08T15:12:19Z","title":"ConvMAE: Masked Convolution Meets Masked Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.03892","snapshot_observed_at":"2026-08-10T22:02:14.423243Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.423243Z"},"links":{"cited_paper":"/paper/2205.03892","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:a8d7ff942a83a28f6d24843072a2a644fef8a479a7900aa87d21f485f48ff50c","observation_id":"2d5d574d-b178-4bd9-99bf-22b199494f06","resolution":{"observed_at":"2026-08-10T22:02:14.423243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.907653Z","title":"Garrido, R","venue":null,"work_id":"287c0f50-2ef1-4ed3-8b2d-02fa25482968","year":2023},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.427531Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:04bbe0ebc70fa98f49dddde1c9dac687df955592c399794da3bbe0e2b142c415","observation_id":"1a1e3e74-195b-4c78-8d0c-c611d32683a8","resolution":{"observed_at":"2026-08-10T22:02:14.911140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.434735Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.434735Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:ef4a7f7f3b9e0c9d51e4df945a4b1d027421fb18d7e5088ca7d7b63aac788116","observation_id":"29574cbb-8d17-45f8-995d-1c94588474c2","resolution":{"observed_at":"2026-08-10T22:02:14.434735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.438544Z","title":"Johnson, B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.438544Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:f4fb2db715a1461e57f1e3cfbdfa7b9f1c88b0dfbd494ea1e9891c6f49c18d24","observation_id":"4c534ad5-e2dd-4449-baad-e91a7ca24efb","resolution":{"observed_at":"2026-08-10T22:02:14.438544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.443266Z","title":"Krizhevsky, G","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.443266Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:67a0ba435d03056c254477ea0ba4bf5a54151ed351f77b4b98d0b409fcff2cd5","observation_id":"c67b97bb-197b-49dc-94b5-033995d88618","resolution":{"observed_at":"2026-08-10T22:02:14.443266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.891353Z","title":null,"venue":null,"work_id":"195ae59d-6e3b-4a32-9e3b-22097a3c3c04","year":2024},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.447505Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:ffe53fe3a932f653cc18ad69b7b228f792058aee7cdd60c438afc2985295a7e5","observation_id":"de156172-0c93-4fb1-8b67-13a8c8023aaa","resolution":{"observed_at":"2026-08-10T22:02:14.894971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.451528Z","title":"Loshchilov and F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.451528Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:02f402da91a7332e1e362054cc1245ca652ace1167eb628983554959d3fba2b4","observation_id":"de866086-cf1f-48fd-ad99-c27a85b0482c","resolution":{"observed_at":"2026-08-10T22:02:14.451528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-16T16:39:31.250386Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-10T22:02:14.455087Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.455087Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:5decdc88fbf6564c50a43ae3771712de8e1498b9561a58df9140b44e49b75655","observation_id":"5d8ecc27-ac2e-44d0-8bd7-674830c933ee","resolution":{"observed_at":"2026-08-10T22:02:14.455087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.459603Z","title":"Russakovsky, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.459603Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:12836cd5f6d6465e8e4eac25affe21b1a28e7e14675b68ecae6178a6364a8a15","observation_id":"ca43ae86-7477-47e7-a85b-82bba5f1ce4e","resolution":{"observed_at":"2026-08-10T22:02:14.459603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.875356Z","title":null,"venue":null,"work_id":"0ba7dfc8-0e23-403b-96fc-bd64c57cb5e5","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.463405Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:02186e35f1d7f2f990692861b198420b5ee1c86dddecc69fe41178f5a886ddc8","observation_id":"46d684a6-0d0f-44f7-9545-42c514da374d","resolution":{"observed_at":"2026-08-10T22:02:14.878865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.466900Z","title":"Van der Maaten and G","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.466900Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:903404e2aebf4576f6aa22c4d066004d6139ef0db87928468743920d74e2ca62","observation_id":"327d3105-8b3f-49ff-8ea7-280ce5aa7ca5","resolution":{"observed_at":"2026-08-10T22:02:14.466900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15837","last_updated":"2024-07-22T17:54:41Z","snapshot_observed_at":"2026-08-16T15:17:21.036689Z","submitted_at":"2024-07-22T17:54:41Z","title":"Towards Latent Masked Image Modeling for Self-Supervised Visual Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15837","snapshot_observed_at":"2026-08-10T22:02:14.473655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.473655Z"},"links":{"cited_paper":"/paper/2407.15837","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:95728cd9c91ece634e9def85c025052704fa27ba99277ad3a46094ad19e77468","observation_id":"d85a0800-68cc-41b1-a642-0d38a3609505","resolution":{"observed_at":"2026-08-10T22:02:14.473655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.477448Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.477448Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:18b798f7725f6d1241dba2c5b31f5eccf115bd232fcfdec79669c29e5b21efed","observation_id":"d94b1ec1-9736-4b4c-bf07-647369ac4494","resolution":{"observed_at":"2026-08-10T22:02:14.477448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-08-14T20:41:41.185318Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-10T22:02:14.480687Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.480687Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:e2b2a6f6ed6d0a8b8aaef05064a5b15ebc0c2ef12caa3c0fdd71f821be8a9ef0","observation_id":"dc3d168b-79cc-461d-bffd-b0dd15b12f71","resolution":{"observed_at":"2026-08-10T22:02:14.480687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.858515Z","title":null,"venue":null,"work_id":"6e689fb0-fe9e-4ab2-82c1-9c4d200fb5ca","year":2014},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.484389Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:9d8d094a65cfa17164b60cc0acfee481fde75f447f351613a47c3819ef929608","observation_id":"808799ee-7a1b-4ab6-8fa2-0f19fe33ee2d","resolution":{"observed_at":"2026-08-10T22:02:14.861934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.847946Z","title":null,"venue":null,"work_id":"0684ebda-2c09-4cc3-b118-53b00f9cf5d2","year":2022},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.488862Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:02398efbd50b0deb8980fad74e902ac135c0889bf2388bb017c390dfeda3d572","observation_id":"9a16a01e-ba0c-48a2-8b18-325906609a5b","resolution":{"observed_at":"2026-08-10T22:02:14.851704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:02:14.408238Z","title":"doi: 10.1109/ICCV48922.2021.00951","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling","version":1},"reference_index":9640,"source":"pdf_text","source_observed_at":"2026-08-10T22:02:14.408238Z"},"links":{"citing_paper":"/paper/2501.03005"},"observation_digest":"sha256:c0aee50275175107f2c6f0b63a9475f394a02eccf7331d299c88722eafc03c7b","observation_id":"2045cf14-f635-4683-b08c-e33694d517f4","resolution":{"observed_at":"2026-08-10T22:02:14.408238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.03005","last_updated":"2025-01-06T13:30:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:39:48.183498Z","submitted_at":"2025-01-06T13:30:16Z","title":"PiLaMIM: Toward Richer Visual Representations by Integrating Pixel and Latent Masked Image Modeling"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2501.03005."}