{"as_of":"2026-08-16T09:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1800a886d34581e18fe231049efa645e56e9a39fbca271a22a902aa13dd2e213","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:03:51.366638Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.17837/citation-record","integrity":"/paper/2506.17837/integrity","json":"/paper/2506.17837/citation-record.json","paper":"/paper/2506.17837"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.08243","last_updated":"2023-04-13T17:59:37Z","snapshot_observed_at":"2026-08-13T13:01:01.045106Z","submitted_at":"2023-01-19T18:59:01Z","title":"Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08243","snapshot_observed_at":"2026-08-15T19:03:51.249957Z","title":"https://doi.org/10.48550/arXiv.2301.08243","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.249957Z"},"links":{"cited_paper":"/paper/2301.08243","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:acb01552dfce05387859b6956e8f15b80403a8ee465c2a9c5d9b937c7054c036","observation_id":"454a6692-fb7f-4743-bd7c-d5af91446320","resolution":{"observed_at":"2026-08-15T19:03:51.249957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12210","last_updated":"2023-06-28T14:15:22Z","snapshot_observed_at":"2026-08-15T04:32:08.314372Z","submitted_at":"2023-04-24T15:49:53Z","title":"A Cookbook of Self-Supervised Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12210","snapshot_observed_at":"2026-08-15T19:03:51.255701Z","title":"https://doi.org/ 10.48550/arXiv.2304.12210","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.255701Z"},"links":{"cited_paper":"/paper/2304.12210","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:167d455877dfbcc5a0a1595a2d125d1c6c1b46c4786ad636d7aa9a49230e50a4","observation_id":"9bb65f6c-fb2d-4022-8b33-d6d71318384b","resolution":{"observed_at":"2026-08-15T19:03:51.255701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:03:51.837913Z","title":null,"venue":null,"work_id":"86fe00d5-13f4-47f2-b86c-466ec55ee240","year":null},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.260914Z"},"links":{"citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:0477c738d3e78eb932fec05bcf6f7de70263a930ff2e10059139dbee53efe883","observation_id":"8121a274-e2f5-48b6-8b16-60d06a9e5b17","resolution":{"observed_at":"2026-08-15T19:03:51.842647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T19:03:51.266312Z","title":"https://doi.org/10.48550/arXiv.2005.14165","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.266312Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:9e0e0ffe27fd69428afbcf4b03124b9974f7d5e99db2f4c9dc1a8ce9da5ec58f","observation_id":"a0b7c8d7-d070-4498-807d-490c13d9dd08","resolution":{"observed_at":"2026-08-15T19:03:51.266312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05709","last_updated":"2020-07-01T00:09:08Z","snapshot_observed_at":"2026-08-15T20:49:51.676387Z","submitted_at":"2020-02-13T18:50:45Z","title":"A Simple Framework for Contrastive Learning of Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05709","snapshot_observed_at":"2026-08-15T19:03:51.271746Z","title":"https://doi.org/10.48550/ arXiv.2002.05709","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.271746Z"},"links":{"cited_paper":"/paper/2002.05709","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:4052e18eab1c5e6a31f9c821e6a58143a419657b3caefff1314ebf36900fc753","observation_id":"93e3c8aa-063c-426a-a927-f8e620d28b7d","resolution":{"observed_at":"2026-08-15T19:03:51.271746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07115","last_updated":"2022-07-18T17:56:53Z","snapshot_observed_at":"2026-08-13T15:03:55.961618Z","submitted_at":"2022-07-14T17:59:37Z","title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","version":2},"cited_work":{"arxiv_id":"2207.07115","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.07115","snapshot_observed_at":"2026-08-15T19:03:51.677469Z","title":"XMem: Long-Term Video Object Segmentation with an Atkinson-Shiffrin Memory Model","venue":"cs.CV","work_id":"5d6511dc-c84d-4ba4-b4ce-2c38243bcbe1","year":2022},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.276807Z"},"links":{"cited_paper":"/paper/2207.07115","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:e1df4d4c1ef5516241f0acc63f78cb9acf4424135e5b8f3511170f425cc4e2c3","observation_id":"64e18d47-3983-42a1-acaf-94b5243a20bd","resolution":{"observed_at":"2026-08-15T19:03:51.682248Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:03:51.823115Z","title":null,"venue":null,"work_id":"30d585d3-8048-4552-9c5d-7a4fbce4854c","year":2024},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.281892Z"},"links":{"citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:dfab0a31bec28fd5d008a9f258a750b6a8e6a5facbd3efb753772a1ffb9510ed","observation_id":"9e43a85d-2eac-4ecf-86fa-cb64b260a589","resolution":{"observed_at":"2026-08-15T19:03:51.827606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06592","last_updated":"2023-12-11T18:27:42Z","snapshot_observed_at":"2026-08-13T06:54:28.777007Z","submitted_at":"2023-12-11T18:27:42Z","title":"Flexible visual prompts for in-context learning in computer vision","version":1},"cited_work":{"arxiv_id":"2312.06592","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06592","snapshot_observed_at":"2026-08-15T19:03:51.657082Z","title":"Flexible visual prompts for in-context learning in computer vision","venue":"cs.CV","work_id":"2e3f4221-64b4-4f0d-9699-9367b2d0038f","year":2023},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.286916Z"},"links":{"cited_paper":"/paper/2312.06592","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:3fe90753b78ce194828143ccac52a8b34f60a86776da691f0d4123db49338df9","observation_id":"5dfa5448-94c9-47cc-8d79-8f8e585284f2","resolution":{"observed_at":"2026-08-15T19:03:51.661903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06377","last_updated":"2021-12-19T19:23:25Z","snapshot_observed_at":"2026-08-15T19:53:40.614050Z","submitted_at":"2021-11-11T18:46:40Z","title":"Masked Autoencoders Are Scalable Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06377","snapshot_observed_at":"2026-08-15T19:03:51.291799Z","title":"https://arxiv.org/abs/2111.06377v3 (Nov 2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.291799Z"},"links":{"cited_paper":"/paper/2111.06377","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:59023ca418f86c5c92d91c5b769b34ecd6d3434bda020646557fe5258940fc22","observation_id":"74f67727-1406-4ed0-8c65-315d803dc0ca","resolution":{"observed_at":"2026-08-15T19:03:51.291799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:03:51.809136Z","title":null,"venue":null,"work_id":"76f5a94f-145e-48e0-9943-1027b7973dfa","year":2020},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.296558Z"},"links":{"citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:76c2d8e9455def349f088fb0c0b1e5cffa88e3f4d5ae7b1595aaf2c50032c9db","observation_id":"7c1c298a-4172-4f60-b75d-359d0f369387","resolution":{"observed_at":"2026-08-15T19:03:51.813666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-15T19:03:51.300902Z","title":"https://doi.org/10.48550/arXiv.1512.03385","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.300902Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:4f8fea74ba745c68e9600c691128aea5e3a756b4338e6a902ac46c0b64713af4","observation_id":"5ad3ffdf-baaf-47f8-818a-79c88d738bdb","resolution":{"observed_at":"2026-08-15T19:03:51.300902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T19:03:51.305711Z","title":"https://doi.org/10.48550/arXiv.1711.05101","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.305711Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:e2d2097fba7a0b7fcefd7b5f272e1879dd153b7a496329b070e4af4a14263636","observation_id":"a61c7f6c-3616-455e-992c-0c9fb1e2dc82","resolution":{"observed_at":"2026-08-15T19:03:51.305711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:03:51.794894Z","title":null,"venue":null,"work_id":"26765ba0-b3fe-4d05-a71d-a580e4be5245","year":2024},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.310632Z"},"links":{"citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:9d3cd981ad0ae78095ffe4fa0024d0cd7eeeeee9709a480085c458883c836469","observation_id":"9bc5e8e0-c8b6-4b49-a94e-3e3822cc0424","resolution":{"observed_at":"2026-08-15T19:03:51.799412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-15T19:03:51.315096Z","title":"https://doi.org/ 10.48550/arXiv.2103.00020","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.315096Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:5049170ef672ccebb91d887e123ae98a61815c56f984b2ca6d0c0d35df4cd948","observation_id":"6de15cec-bc87-4d86-a599-aededd6a225d","resolution":{"observed_at":"2026-08-15T19:03:51.315096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:03:51.780208Z","title":null,"venue":null,"work_id":"17835c58-2481-42ba-b410-a7b44e9507db","year":null},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.319852Z"},"links":{"citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:b632230dc211e34610aca6d4380c2c7c8783e4b14d06d8fdb9662325ad1b3d82","observation_id":"8244d346-8027-48fa-a6c8-f813c3e2536d","resolution":{"observed_at":"2026-08-15T19:03:51.785396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06888","last_updated":"2018-03-20T01:02:45Z","snapshot_observed_at":"2026-08-14T21:05:22.491587Z","submitted_at":"2017-04-23T06:03:56Z","title":"Time-Contrastive Networks: Self-Supervised Learning from Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06888","snapshot_observed_at":"2026-08-15T19:03:51.324403Z","title":"https://doi.org/10.48550/arXiv.1704.06888","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.324403Z"},"links":{"cited_paper":"/paper/1704.06888","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:af3bcc399ade3fd9a0ad01d4884ce7ea0bf98dc91bf887a0a1663720082aa9c3","observation_id":"0e1ba129-5cac-4391-8430-e53fb36a6c0a","resolution":{"observed_at":"2026-08-15T19:03:51.324403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2304.04748","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:03:51.580344Z","title":"https://doi.org/10.48550/arXiv","venue":null,"work_id":"56e2e2f7-9356-4b77-87a7-6d75b11615bb","year":2023},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.328985Z"},"links":{"citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:962cf2e24017e7f454368c23f5e7573860458ed0e7dbc614bf4885cb68d7e660","observation_id":"1184ad4d-bfcf-4e1b-8bb9-e54506e9d9af","resolution":{"observed_at":"2026-08-15T19:03:51.585030Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:03:51.764731Z","title":"Machine Learning109(2), 373–440 (Feb 2020)","venue":null,"work_id":"368036b5-09c9-43aa-8aab-1ec98723de88","year":2020},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.333369Z"},"links":{"citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:1b3bceebe3d9343b6b315d725edcb6c453795ba6d32542dbf0578e097982c502","observation_id":"f349f826-fdfb-4f84-9f74-214676b9722c","resolution":{"observed_at":"2026-08-15T19:03:51.770315Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02499","last_updated":"2023-03-24T07:10:47Z","snapshot_observed_at":"2026-08-13T13:27:54.563988Z","submitted_at":"2022-12-05T18:59:50Z","title":"Images Speak in Images: A Generalist Painter for In-Context Visual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02499","snapshot_observed_at":"2026-08-15T19:03:51.338053Z","title":"https://doi.org/10","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.338053Z"},"links":{"cited_paper":"/paper/2212.02499","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:08bc435840745fbbd753656aa5b12ff551227fbbeac4ed96b261c3d1209cf016","observation_id":"05f626f3-e4fb-4177-aae3-a50abf0b6fb8","resolution":{"observed_at":"2026-08-15T19:03:51.338053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10163","last_updated":"2022-10-18T21:06:29Z","snapshot_observed_at":"2026-08-14T21:04:14.517226Z","submitted_at":"2022-10-18T21:06:29Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10163","snapshot_observed_at":"2026-08-15T19:03:51.342688Z","title":"https://doi.org/10.48550/arXiv","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.342688Z"},"links":{"cited_paper":"/paper/2210.10163","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:5cf31f64390bf8474882b91f1509cbb52662aba433398188d1cb47c7b0f8bd73","observation_id":"2318cd51-29dc-462e-9e32-136d476f8ef6","resolution":{"observed_at":"2026-08-15T19:03:51.342688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:03:51.347569Z","title":"Journal of Big Data3(1), 9 (May 2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.347569Z"},"links":{"citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:71f92916220bbd03fe247de0d797b6f9f15470da1862f370708b5cdcaaeac331","observation_id":"f54c9b60-7ec4-4877-a2d8-ed2a0f680d00","resolution":{"observed_at":"2026-08-15T19:03:51.347569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3657632","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:03:51.447854Z","title":"ACM Computing Surveys56(12), 1–38 (Dec 2024)","venue":null,"work_id":"f8a40448-3ba0-47fe-85a9-e796a6fdea5d","year":2024},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.352425Z"},"links":{"citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:adf830635a93cd4c84f98ae06314cc546329762f94de2cfc43b61a663c76e96d","observation_id":"16214fa8-9656-41fb-8f22-90da1c139e68","resolution":{"observed_at":"2026-08-15T19:03:51.452304Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03648","last_updated":"2023-11-07T01:39:00Z","snapshot_observed_at":"2026-08-13T05:31:00.465942Z","submitted_at":"2023-11-07T01:39:00Z","title":"Instruct Me More! Random Prompting for Visual In-Context Learning","version":1},"cited_work":{"arxiv_id":"2311.03648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.03648","snapshot_observed_at":"2026-08-15T19:03:51.430197Z","title":"Instruct Me More! Random Prompting for Visual In-Context Learning","venue":"cs.CV","work_id":"77f9bdd0-11a3-436d-b375-49c01e6bcf1f","year":2023},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.356964Z"},"links":{"cited_paper":"/paper/2311.03648","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:ef7b70f96f4e4f01b1e46b53fbb8aa0b7ce95443415dee766a94a579b79650cd","observation_id":"a6d976ae-a6fd-42cd-9410-8713a8962842","resolution":{"observed_at":"2026-08-15T19:03:51.437151Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13670","last_updated":"2023-02-01T08:38:14Z","snapshot_observed_at":"2026-08-13T12:54:18.795571Z","submitted_at":"2023-01-31T14:40:05Z","title":"What Makes Good Examples for Visual In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13670","snapshot_observed_at":"2026-08-15T19:03:51.361662Z","title":"https://doi.org/10.48550/arXiv.2301.13670","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.361662Z"},"links":{"cited_paper":"/paper/2301.13670","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:2859bdae45a91a142d1183114f57b77862439c8b701ca060191bf1486392ba49","observation_id":"6d305f84-a168-4b15-aa62-8542a63fe42b","resolution":{"observed_at":"2026-08-15T19:03:51.361662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00874","last_updated":"2024-12-04T23:51:25Z","snapshot_observed_at":"2026-08-14T15:45:17.895995Z","submitted_at":"2024-08-01T18:49:45Z","title":"Medical SAM 2: Segment medical images as video via Segment Anything Model 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00874","snapshot_observed_at":"2026-08-15T19:03:51.366638Z","title":"https://doi.org/10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:03:51.366638Z"},"links":{"cited_paper":"/paper/2408.00874","citing_paper":"/paper/2506.17837"},"observation_digest":"sha256:5604a6fc1aa9663c65cb0a99616ac9fe84a2ff63d3124e6228d7ec8107b92b65","observation_id":"af25cb07-9809-4150-ba97-6d7f3998bc1d","resolution":{"observed_at":"2026-08-15T19:03:51.366638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17837","last_updated":"2025-06-21T22:26:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T05:09:36.477911Z","submitted_at":"2025-06-21T22:26:20Z","title":"Time-Contrastive Pretraining for In-Context Image and Video Segmentation"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2506.17837."}