{"as_of":"2026-08-22T11:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16165fba2d6ff4143ceb3e3b5e7ba18af817a679c6cb5973712e55d819fd9b6f","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:01:17.880281Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22864/citation-record","integrity":"/paper/2506.22864/integrity","json":"/paper/2506.22864/citation-record.json","paper":"/paper/2506.22864"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T22:01:14.958121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:14.958121Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:99137e4d23265690df272b312f779e5c685e3a3389e28dd6a444d6cc76d2d9cb","observation_id":"af4f88cd-f1e6-4f4c-9cb4-b3441e5314f7","resolution":{"observed_at":"2026-08-06T22:01:14.958121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:01:15.010180Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.010180Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:05a45b90578329f810a2e7a85756270f680edb76d470f8edc46a0dfd1af85583","observation_id":"3a10a0ca-2cbb-439e-88d9-a3f07552ffb7","resolution":{"observed_at":"2026-08-06T22:01:15.010180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-20T14:30:51.079652Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T22:01:15.129919Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.129919Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:b732f4b1e17b69034e274d46e5aba888189adda6b0f4e0a566d781794f93458c","observation_id":"64618d66-c776-4cb6-9173-2fe80d8a8943","resolution":{"observed_at":"2026-08-06T22:01:15.129919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.493803Z","title":null,"venue":null,"work_id":"674002d2-cfa2-414e-8ccf-ec3f4075d985","year":2020},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.198419Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:d70e99468d52f96cb3eb45ced32ec50015008e55bc01e148070222916f9dc103","observation_id":"5b12c948-8986-4611-ab17-fb54f75b3d24","resolution":{"observed_at":"2026-08-06T22:01:23.499007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.477184Z","title":null,"venue":null,"work_id":"3b397fd9-229b-4ece-b82e-de81aac9bb21","year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.271304Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:ae16c71271d9682d3426bbd13aa9ebd85274e62dcf73cbe9963985bfe4670362","observation_id":"332e1244-27e0-485f-8b37-2cb6f057d9ac","resolution":{"observed_at":"2026-08-06T22:01:23.482402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.459544Z","title":null,"venue":null,"work_id":"12944594-e9db-4b9f-8f9d-3319592549e4","year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.306843Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:70236e80f70fef1c11b815bd27084ee851ad79786110cc7b717a7508fe616c0d","observation_id":"356208b5-8602-4cbc-873f-65f5a5ca0318","resolution":{"observed_at":"2026-08-06T22:01:23.465112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.441941Z","title":null,"venue":null,"work_id":"eb9fd8d8-1bd5-4485-be69-b7046a9473da","year":2021},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.378625Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:a9e464b4bc5cabfe5f908fa5e7fed25fc8eb89ac7a622aefc87a91742ed3691f","observation_id":"6de720c7-2a90-488b-a3e1-66a9e9e49211","resolution":{"observed_at":"2026-08-06T22:01:23.447491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.422462Z","title":"Fleet, J","venue":null,"work_id":"a4ca8435-c367-4d78-94ac-7c916d6541b6","year":2018},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.439576Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:e608fb02ab2c0880f81342e72e7a978ca5d33e8bf0a10c8cc155848138c641f8","observation_id":"1da9c28a-5a96-4511-af27-b4b957dcfc36","resolution":{"observed_at":"2026-08-06T22:01:23.429173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.201558Z","title":null,"venue":null,"work_id":"a4439fe5-2d52-4993-b0f9-d712c66e1d02","year":2013},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.537066Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:08b5c5458a51fccb608427b9e94f5fda3f8eeb005256e44aeb735141d16b13d2","observation_id":"e7a7dd82-8a36-44f0-9a5d-daaaf6edddfd","resolution":{"observed_at":"2026-08-06T22:01:23.316252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:22.970278Z","title":null,"venue":null,"work_id":"ffa240fc-aa40-4753-9ae1-77c01e9050df","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.642411Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:5fa9f0fb94667ac5844d005d19f0f3c46a18d2416a176428e8fe3a328608859b","observation_id":"d7a12c41-6613-406a-8082-2147d9a64fe2","resolution":{"observed_at":"2026-08-06T22:01:23.078550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:22.760606Z","title":null,"venue":null,"work_id":"5f8b3f29-e399-4b0b-9168-d90c62eb0cfe","year":2021},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.701554Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:621adcfcfc57e3c7c4ccc549daf79f791f5c440e88be4f8614a083bfb271df00","observation_id":"633cd53e-d8e8-4593-aded-8eccdf33c7a1","resolution":{"observed_at":"2026-08-06T22:01:22.862994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:22.542495Z","title":null,"venue":null,"work_id":"c3b73791-a1cc-419c-a094-28a3a4fcf806","year":2021},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.812184Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:ab7dbef347b1a6dc4a9d566285fbabd2863e7363eafcdc755a4cd7ffcfb40fe0","observation_id":"6ab782b1-0f51-4f29-9a7d-7fe154942768","resolution":{"observed_at":"2026-08-06T22:01:22.640324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:22.198071Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Girshick","venue":null,"work_id":"7ed7b983-6d9f-4589-b969-12dd29ab496a","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.862222Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:a09cb227ca44efd0d1996e7d5817d001f2111936fc9545cc92a57c4661d0027f","observation_id":"6f2789e6-1d4c-4168-ac1b-a8818913e3c0","resolution":{"observed_at":"2026-08-06T22:01:22.394073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:15.909428Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.909428Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:cc20025664fe40321ece7e56a2a993e39d1c6f3ccdedbd43cdd75237fe83522a","observation_id":"1b278cd2-1984-44ec-96e6-0cd0f5da9c7e","resolution":{"observed_at":"2026-08-06T22:01:15.909428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:21.650271Z","title":null,"venue":null,"work_id":"14d8e2de-9222-499c-bc09-b21cfe1b96ad","year":2018},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.102523Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:081f433013231ee1aa89da6a94861ca01d6f353c77146d37cb988de2f07c8326","observation_id":"8ce80548-01d9-4c66-88ad-1f43bf3695b3","resolution":{"observed_at":"2026-08-06T22:01:21.753024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:21.359557Z","title":null,"venue":null,"work_id":"84985729-f7ce-416f-b897-8a29b93ac261","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.180181Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:b57a17fc471c938a96f349e39049251871e5b1954a9cbd701a7c9b4534092f31","observation_id":"a123a3c4-f60f-4ffe-8508-f11ff3a583e1","resolution":{"observed_at":"2026-08-06T22:01:21.517139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:21.135498Z","title":null,"venue":null,"work_id":"3d24c62b-e116-4e8a-8a4c-8f3c587370ac","year":2019},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.263800Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:778146306a46787a75a43c537aadfc068301eed5735dcb2cb474f417d6df196a","observation_id":"a165ea8b-3538-4e2a-890d-4a7ada235aff","resolution":{"observed_at":"2026-08-06T22:01:21.201689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:20.946159Z","title":null,"venue":null,"work_id":"60769629-5c06-4a52-90c3-c066582252d7","year":2025},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.337695Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:7e6085285d5b6f03cccee374483fed5c63281158253f5b8d68a45fc8af57c8ab","observation_id":"cec90bcf-0620-45b7-8391-13ecf95b42a3","resolution":{"observed_at":"2026-08-06T22:01:20.997686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:20.721449Z","title":"Lawrence Zitnick","venue":null,"work_id":"135a0aeb-4c29-49ea-b325-b230857fb6b4","year":2014},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.409999Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:7f86c14adf3bb01319b8bca7142e9d499e23381ac6c9c304f00e64e424650a4a","observation_id":"392d425a-d5d9-4466-b1fa-79a9ff158adc","resolution":{"observed_at":"2026-08-06T22:01:20.807247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:20.448645Z","title":null,"venue":null,"work_id":"b6f1b621-3645-4182-8496-ee9292dbb289","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.465792Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:5b463d98869b0eafdc4da770ec07a08bad08f1540652241594a062d03941e34f","observation_id":"2a9c9549-87f7-4ce9-8b30-1f6eb803151e","resolution":{"observed_at":"2026-08-06T22:01:20.550669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:16.547995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.547995Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:5270896bc0ce892fd9a0831ba9d21ab3fba4a75ead15a30e66001af0a6addbc6","observation_id":"3e54e89f-c239-4a17-862e-ea75631b0ea5","resolution":{"observed_at":"2026-08-06T22:01:16.547995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:20.175227Z","title":"Yuille, and Kevin Murphy","venue":null,"work_id":"b45c373c-6ce5-4134-b1d8-1dbd39105242","year":2016},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.639823Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:607bf6688d474226d189ed7777aee65449a647f8f6dab5532ef0779d4d0d00f2","observation_id":"d5e03549-b518-4fc8-bee1-aab083ba1f9d","resolution":{"observed_at":"2026-08-06T22:01:20.299450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.909122Z","title":null,"venue":null,"work_id":"8ed54e77-1c23-4ced-83c5-b09139763f17","year":2020},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.739528Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:f46a698f80dc5c93a8c4772e5cf1b553684fd73737922388ee106d13d86c05b9","observation_id":"6aef445c-4043-4b3f-9faf-7d8fa203b189","resolution":{"observed_at":"2026-08-06T22:01:20.002247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.750547Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":"e1a98076-54a1-4bd7-96ee-a6aaf837b4c8","year":2015},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.791637Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:aaac56a4f2c171c3688f2d40bee35b6816878dadf0da256dcf12bec0f5908ae6","observation_id":"02783244-5382-4fe6-a4a9-886c5252e041","resolution":{"observed_at":"2026-08-06T22:01:19.797590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.572442Z","title":null,"venue":null,"work_id":"c7423c3a-fdc3-4127-a636-44f5804b20d2","year":2021},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.883314Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:343700e902289e60bfdd6e3a446295783b969e8e20b112dc855bd0e8528ee878","observation_id":"b2b26024-f779-4822-9c79-7ef3911da8c8","resolution":{"observed_at":"2026-08-06T22:01:19.631058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.415616Z","title":null,"venue":null,"work_id":"97831e64-0d37-4bf8-9be8-ddfc924d244c","year":2025},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.980024Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:6d9ffadb28daca6808684dc3f501c4947e320a43ee895a9271b5babaf9457204","observation_id":"8248b3d5-d73e-4b5d-aed3-92bd39972813","resolution":{"observed_at":"2026-08-06T22:01:19.504047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.169624Z","title":null,"venue":null,"work_id":"d0a6bc25-441c-450a-aa01-7f311bf91263","year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.094244Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:060781e3ed719c214c9c9aeab31ccbb36bab1713e5c5ce24135c0d583ffa215f","observation_id":"85c89b84-f7e0-4ff2-a8eb-d0f13106f0cf","resolution":{"observed_at":"2026-08-06T22:01:19.270633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.014043Z","title":null,"venue":null,"work_id":"414b37a4-60d2-4f79-8192-0babbcfb4f80","year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.186919Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:e175df850753d15a5729adca921e782d73649bd36489a2e20e73160dd663c18e","observation_id":"044c99a1-c2ed-4fd1-ab3e-24ed63f3bdd3","resolution":{"observed_at":"2026-08-06T22:01:19.098647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.852613Z","title":null,"venue":null,"work_id":"a866c9ac-c8d7-44d3-84e5-a03a865711a2","year":2020},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.305749Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:535f0637203e340fef6ebf65eaa059442b87b02ce693c3d686cec1cbe2d48d29","observation_id":"fdae505f-faa3-48c0-a3d5-cf31a993905f","resolution":{"observed_at":"2026-08-06T22:01:18.923242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.740640Z","title":null,"venue":null,"work_id":"7ad1fb43-b86f-4de1-b92b-6939ea31ff0d","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.381675Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:e5496e33b210646d35c1f2bb9506b51d2185f13fd3aa9777f35fc0cda9c9db1f","observation_id":"a60be571-2172-4c6e-a908-91698f9252f7","resolution":{"observed_at":"2026-08-06T22:01:18.787682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.613865Z","title":null,"venue":null,"work_id":"9f2854a7-30e9-4599-909d-073d5e7c7e65","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.476487Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:8c2ab45c1d8bd6044033faaa55499b2ec9681207fc876a181e4dc18f1a35f24d","observation_id":"a3f708d9-28b8-4d12-8e94-35b26fe0719b","resolution":{"observed_at":"2026-08-06T22:01:18.667208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.513307Z","title":null,"venue":null,"work_id":"84d8a585-52f9-4fb6-8bff-7124f1e3cf00","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.538226Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:ee2d6e22b7432fb2b1896254e743922676014809843ce464fb5520334ea3549e","observation_id":"7f6889c7-85af-487e-8c4d-b9db7fcf056d","resolution":{"observed_at":"2026-08-06T22:01:18.574967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-20T16:03:44.934037Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-06T22:01:17.601173Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.601173Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:b1ee284ef853b71bb2d787b154ad17716b4e58b1034bdd9fc2de05b0f78bcd71","observation_id":"2d7ca62d-95d5-4b56-b589-3428429f9c51","resolution":{"observed_at":"2026-08-06T22:01:17.601173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.398706Z","title":null,"venue":null,"work_id":"ac685a68-635f-4bf8-bcf2-fbbb70e35a52","year":2022},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.649884Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:617c15e56ece3bc322ce68aadfa53e80c80bc5934462c892cc324887ebd9edd0","observation_id":"36088f1c-0028-4d58-883b-6ac615ef85cb","resolution":{"observed_at":"2026-08-06T22:01:18.452170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.306177Z","title":"Berg, and Tamara L","venue":null,"work_id":"5e5cee78-1a40-462d-bb56-2303a5a88695","year":null},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.711250Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:22427438a8835681df1f9364d9befaa34195e97a3269cc7091c02587cce17a8f","observation_id":"979ca89a-df6f-4ef3-a184-98364b1be7d6","resolution":{"observed_at":"2026-08-06T22:01:18.341334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:17.827019Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.827019Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:e5fe3db1972472dcf2d610550939e775039637cff04cd8415fe49c94fc824d5a","observation_id":"ea511b3d-f2be-49e2-9734-8a8d053b875a","resolution":{"observed_at":"2026-08-06T22:01:17.827019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.064027Z","title":null,"venue":null,"work_id":"025ffca2-c010-4b4c-88b8-e970cb248a4a","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.880281Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:a2f64d543ba9184ee31936d2561814ac2332b8327286a2d5bc3a9e12356d51ae","observation_id":"c8f682cb-2f3c-4ff2-84ad-88dea724241b","resolution":{"observed_at":"2026-08-06T22:01:18.111593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.193775Z","title":"InEuropean Conference on Computer Vision, Bastian Leibe, Jiri Matas, Nicu Sebe, and Max Welling (Eds.)","venue":null,"work_id":"6f93a804-0ed0-4bbe-a6f4-90d44ba35320","year":null},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.770840Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:8670183d28a58963968a5377c6ea4c95b27a8a61ca842d9c10bce10c9cfa1dfa","observation_id":"9e3e4cf0-5dac-4280-b91d-48a4f9cae3ca","resolution":{"observed_at":"2026-08-06T22:01:18.245858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:21.904463Z","title":"InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"379b4bd0-9072-4c5d-9132-d66fc30c2f75","year":null},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.997379Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:db962446ba784edf69d95e4d55b15eb1a7a971a6bfa3699b9b3c14d1ad07f9f2","observation_id":"fb30d2ae-831b-4437-9341-13f24448d513","resolution":{"observed_at":"2026-08-06T22:01:22.035731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2506.22864."}