{"as_of":"2026-08-18T22:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a4ec644c42913323899be1e4240ccda89c587130e875b5e04758e8196b918e75","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:50:38.904354Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07886/citation-record","integrity":"/paper/2608.07886/integrity","json":"/paper/2608.07886/citation-record.json","paper":"/paper/2608.07886"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:40.219748Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":"1a52c4c1-0d46-4fb9-8890-81edb2644ef1","year":2025},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.596093Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:10ec41f8816e14ac267ca32fbaace64cd5df30d1c02c7fcd46823f2bda1f77ac","observation_id":"a42b76bf-1cfe-4317-8a5c-a46d102f6d8e","resolution":{"observed_at":"2026-08-12T00:50:40.224535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.602120Z","title":"Molmo2: Open weights and data for vision-language models with video understanding and grounding, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.602120Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:ffdbef13d6546f9f8ee9b70e294cc5d871a65cfd99b4dd36ca2efcf60c222234","observation_id":"0da74421-f914-4eba-b191-0ecc1b6324fb","resolution":{"observed_at":"2026-08-12T00:50:38.602120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.608089Z","title":"Molmopoint: Better pointing for vlms with grounding tokens.arXiv preprint arXiv:2603.28069, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.608089Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:9cf1507576a0f93f4b4bfa144fed330d7478675ba70ce0316ba0258307b5ba4b","observation_id":"0d8618f7-da09-4da1-a378-680acfce865c","resolution":{"observed_at":"2026-08-12T00:50:38.608089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.613911Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.613911Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:8765d48611ea25f23b6ef76f4b5c7904016c89f4bd5cfecb2332b3bddf53b010","observation_id":"66de1c08-f1cb-40b4-b1cb-e060113ae781","resolution":{"observed_at":"2026-08-12T00:50:38.613911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.618665Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.618665Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:c9512e3b8286e8c968e65c06c18b0d253b0d1c885319ee41cef397be87efb40d","observation_id":"e0b4e406-1737-4ae7-a2d3-9020be4852e4","resolution":{"observed_at":"2026-08-12T00:50:38.618665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.624092Z","title":"Modeling context between objects for referring expression understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.624092Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:5f9f909224c9301b01381d61888f81dc9384d82dec4e4e981d200464515b02b2","observation_id":"9a4312cc-44bf-460c-a6c8-e2453b8ba94d","resolution":{"observed_at":"2026-08-12T00:50:38.624092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:40.163918Z","title":"Referring relationships","venue":null,"work_id":"aea26a8b-d758-4b05-852d-02ab91d770ff","year":2018},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.629547Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:fbccd49b43276b71b460ef5d5b606ee6223a82a2eb00c802d60b324c59a01747","observation_id":"adabe624-e8d7-4177-bf97-0a44d01ee053","resolution":{"observed_at":"2026-08-12T00:50:40.168590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.634193Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.634193Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:8082b90732afc8dee87c7da0a8db2b0181d9133e45173852ae5725ab1621209f","observation_id":"184ca318-d921-438b-b73f-68dc0a3b0876","resolution":{"observed_at":"2026-08-12T00:50:38.634193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.639144Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.639144Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:eabebf57ac7e8579780f7f55cedf13f4ae3adb98b782af8b8968419c39eb7128","observation_id":"43ee5f8e-a942-4e15-b378-19a5675e0c8a","resolution":{"observed_at":"2026-08-12T00:50:38.639144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:40.124647Z","title":"Phrasecut: Language-based image segmentation in the wild","venue":null,"work_id":"1b71aa4f-83bc-4802-956b-44eb0af256d7","year":2020},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.644558Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:5ec6da7d9b311f8480503623afeee2f9f7a4ec899ca289db1d19030c8cf71eb4","observation_id":"fe7e47d9-79fc-495d-b427-85e69978b255","resolution":{"observed_at":"2026-08-12T00:50:40.129902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T00:50:38.650685Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.650685Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:35ca1aa131ae0e60083f6e73919ba58e0914ec4e5a285948acb4941989448efd","observation_id":"d7db2878-97fa-4012-ae06-1a882c876e72","resolution":{"observed_at":"2026-08-12T00:50:38.650685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.655891Z","title":"Sam 3: Segment anything with concepts, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.655891Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:f23fe9d1cd933ead333a93ac81dd8865738a3fafb6abb14b7ce563360ffedb17","observation_id":"da33c1f9-b611-415c-8544-6be218767bee","resolution":{"observed_at":"2026-08-12T00:50:38.655891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:40.095295Z","title":"Clark.Using Language","venue":null,"work_id":"01390059-ad4e-4e1d-b615-35c28279cb49","year":1996},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.661129Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:0c17434e9a2e675d8873a0b503ea1a68c21771d69e4804d27bfaf07bfec3ca85","observation_id":"a60519be-7c22-484e-adc7-3cdc25c8af31","resolution":{"observed_at":"2026-08-12T00:50:40.100677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:40.076469Z","title":"Clark and Susan E","venue":null,"work_id":"26df8f87-6f3f-4c2f-9c7d-05a0ba54be80","year":1991},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.665612Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:64393ea56b4fdbd2144fb32bcf858b30c63aa15bf34b58af9510820579486b12","observation_id":"5caf5415-ac91-4220-974f-016cfe5ffdd7","resolution":{"observed_at":"2026-08-12T00:50:40.081751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:40.057396Z","title":"Spatial mental models","venue":null,"work_id":"76138ecc-a1ad-4582-a73e-bccb4d46e94b","year":1991},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.670644Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:84cbad043d2c40ac371da2aca3c6a9a5a8adfc9617b6010d8adaeb2c13ea2e32","observation_id":"091329e9-49ff-4360-86a8-fe8c0a80beb3","resolution":{"observed_at":"2026-08-12T00:50:40.062604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:40.036442Z","title":"Taylor and Barbara Tversky","venue":null,"work_id":"224ca651-45fb-477b-b4c5-25d9b060d51f","year":1992},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.675891Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:729a32adde3e62d7d7c27d4f7f38e79888b6522182a34ffb7418add0b51e0d23","observation_id":"16eda70f-eb8d-4b3b-9c5e-1d806f96b16a","resolution":{"observed_at":"2026-08-12T00:50:40.042794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04193","last_updated":"2024-03-10T01:55:47Z","snapshot_observed_at":"2026-08-16T22:03:34.718497Z","submitted_at":"2023-11-07T18:34:02Z","title":"Selective Visual Representations Improve Convergence and Generalization for Embodied AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04193","snapshot_observed_at":"2026-08-12T00:50:38.681678Z","title":"Selec- tive visual representations improve convergence and generalization for embodied ai.arXiv preprint arXiv:2311.04193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.681678Z"},"links":{"cited_paper":"/paper/2311.04193","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:a4d55d19674f9e03f90cd5f33e208e5884727c42a83dc1488f9753042b067dad","observation_id":"20626ba8-a4d7-44bb-890a-8fdc547ece8b","resolution":{"observed_at":"2026-08-12T00:50:38.681678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.687795Z","title":"Treisman and Garry Gelade","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.687795Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:8f873c9f5a614e11879ce1d3edcf1fde4c7f265dba448e85a99983716a6f0aa2","observation_id":"e1d81fc1-253e-48a6-8da9-85276ba61ee0","resolution":{"observed_at":"2026-08-12T00:50:38.687795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.997437Z","title":"Structure-mapping: A theoretical framework for analogy.Cognitive Science, 7(2):155–170, 1983","venue":null,"work_id":"6489ea44-fb66-4fdd-a955-9b7d42947e55","year":1983},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.692912Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:9b6967299ff045d1062dd0f924b5bad0bbb44bc9d90d0debfdd13f5888f86a5d","observation_id":"1ad7fc1f-0fed-4657-9285-00786092948a","resolution":{"observed_at":"2026-08-12T00:50:40.004128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.975155Z","title":"Who are you referring to? coreference resolution in image narrations","venue":null,"work_id":"36b29a31-1722-4570-ac8b-103e2596215c","year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.698415Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:3d83088deef0fa500f1c183c0f6b9175f26771d789d8860804e3d8fec2f982f7","observation_id":"ece0bc17-9665-4074-b590-4da422e5336c","resolution":{"observed_at":"2026-08-12T00:50:39.981271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.956485Z","title":"Understanding natural language.Cognitive Psychology, 3(1):1–191, 1972","venue":null,"work_id":"a4a3e0e9-ebec-4fa1-bc84-849013ee1e4b","year":1972},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.703883Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:abca799586ed29eac9483b9f5cee149108b17433fb61f4273de7f2d7b94de099","observation_id":"58fd4ad6-37ad-4f50-a2a1-1e1cec8bc804","resolution":{"observed_at":"2026-08-12T00:50:39.962247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.938979Z","title":"Levesque, Ernest Davis, and Leora Morgenstern","venue":null,"work_id":"6cd700b4-b3f7-4bfb-bac4-45d36201301c","year":2012},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.709378Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:8660ed76728e370dadd5c0bb0158b11b1f35b05a2dd06f29d53e90c7e2f67997","observation_id":"62a3f04f-6685-4013-9c57-60541eaf82a1","resolution":{"observed_at":"2026-08-12T00:50:39.944755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.921212Z","title":"Picturing ambiguity: A visual twist on the winograd schema challenge","venue":null,"work_id":"6e31acd3-c1f8-485c-8bf2-ac7dff726633","year":2024},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.716012Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:37d2b85e91b4eb1b7c936b9aea0b9e5956bffb4d5a7979f60a42b291ecf42166","observation_id":"35e35cf0-2588-47d3-af40-f71304ec8583","resolution":{"observed_at":"2026-08-12T00:50:39.926171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.721658Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.721658Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:96ca9a3a83dff5605a70fb4188d611d5154159fb0ff7d3457ef06be1ef34cdc4","observation_id":"37941aa8-3b7e-45aa-9aa0-9a10af435fc8","resolution":{"observed_at":"2026-08-12T00:50:38.721658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07141","last_updated":"2026-05-08T02:20:40Z","snapshot_observed_at":"2026-08-18T15:11:18.985562Z","submitted_at":"2026-05-08T02:20:40Z","title":"Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07141","snapshot_observed_at":"2026-08-12T00:50:38.728318Z","title":"Qwen3-vl-seg: Unlocking open-world referring segmentation with vision-language grounding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.728318Z"},"links":{"cited_paper":"/paper/2605.07141","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:6e71fa1dba1e052d5c4b5f1390ed062221d5b466224fe42035b763840fe5f3c7","observation_id":"bd57747f-0275-479e-a477-9c9d0f86943a","resolution":{"observed_at":"2026-08-12T00:50:38.728318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.889771Z","title":"One trajectory, one token: Grounded video tokenization via panoptic sub- object trajectory","venue":null,"work_id":"24801645-875f-4c11-bf00-76b31a27a044","year":2025},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.734939Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:aaa9aa13083bba48f614c8591fbabc01c501422004e54001e7306367c066647d","observation_id":"be17a4c4-c340-4bbc-9141-a727a01ad8a9","resolution":{"observed_at":"2026-08-12T00:50:39.894655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22779","last_updated":"2026-06-03T09:11:47Z","snapshot_observed_at":"2026-08-11T02:30:31.429201Z","submitted_at":"2026-02-26T09:15:34Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","version":3},"cited_work":{"arxiv_id":"2602.22779","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.22779","snapshot_observed_at":"2026-08-12T00:50:39.326341Z","title":"TrajTok: Learning Trajectory Tokens enables better Video Understanding","venue":"cs.CV","work_id":"2a3d8f83-44c1-47ac-b43f-61b19e9ca681","year":2026},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.739988Z"},"links":{"cited_paper":"/paper/2602.22779","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:bd9d2441b39c48569568ff716373856c2527a9f2ac3c93d9f80916a715273113","observation_id":"172d8766-b817-41d9-8805-e24e05b7de94","resolution":{"observed_at":"2026-08-12T00:50:39.331928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.744971Z","title":"Youtu-vl: Unleashing visual potential via unified vision-language supervision","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.744971Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:8f3d1b796ab5802914efdee3e8327621f361910196968c836d72b6831274add6","observation_id":"85ea8995-84c7-438a-8382-94d1a09a2c77","resolution":{"observed_at":"2026-08-12T00:50:38.744971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.872819Z","title":"Grounded language-image pre-training","venue":null,"work_id":"bc8e0626-9a71-4262-8c29-a95d6d3467ce","year":2022},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.749934Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:039a3259137a589eff15fe7c47e5780c9ab4d25730154c6db12cb6e5c5c3de7e","observation_id":"7a913f9e-ad34-49cb-a90b-375542c7f88f","resolution":{"observed_at":"2026-08-12T00:50:39.878393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.855389Z","title":"Glipv2: Unifying localization and vision-language understanding.Advances in Neural Information Processing Systems, 35:36067–36080, 2022","venue":null,"work_id":"197b6249-9fd5-4cee-ab94-5c090297114b","year":2022},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.754251Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:707ffe507fb8bd7b1b15d5a2ac1d40f09030f3784fdc49a17e1c0ce5d2ef062a","observation_id":"fddb5876-cb24-4df8-a84f-4831cc1bafc9","resolution":{"observed_at":"2026-08-12T00:50:39.861293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.834554Z","title":"Synthetic visual genome","venue":null,"work_id":"066dcb52-64f7-4896-bb2b-9aae68b88a52","year":2025},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.759067Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:8d46b92023d723c8048884b991d0630d8c61606fe3139c15c27f9305fd1125c1","observation_id":"77cd3d39-85d9-4e5d-bfdd-fba5d0e41a17","resolution":{"observed_at":"2026-08-12T00:50:39.840478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.813674Z","title":"You, Daniel Ogbu, Chenhao Zheng, Weikai Huang, Yinuo Yang, Winson Han, Quan Kong, Rajat Saini, and Ranjay Krishna","venue":null,"work_id":"d5b9820d-2e25-42de-b47a-e7d096bc9f02","year":2026},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.764173Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:e77c23f8e47c55dbaf603ab0dc780eb850225f72a3e2684c836750394297f27d","observation_id":"b7ea31fb-e3d0-4c8b-b2b6-cece6cbc090d","resolution":{"observed_at":"2026-08-12T00:50:39.820974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.768528Z","title":"Mdetr-modulated detection for end-to-end multi-modal understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.768528Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:e36108214c00c345199d59e67db80e5c208779898a72389253d7e8bf349824c8","observation_id":"63783363-2965-4003-b570-7891af021b91","resolution":{"observed_at":"2026-08-12T00:50:38.768528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.773695Z","title":"Detclip: Dictionary-enriched visual-concept paralleled pre-training for open-world detection.Advances in Neural Information Processing Systems, 35:9125–9138, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.773695Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:2322116483429168f5977b48c00026efabd28687d2c8e3e6682204da2686b227","observation_id":"fe798667-ef84-48ed-a666-839e5fe43cdd","resolution":{"observed_at":"2026-08-12T00:50:38.773695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.769066Z","title":"Detclipv2: Scalable open-vocabulary object detection pre-training via word-region alignment","venue":null,"work_id":"105b106a-d604-454e-849f-610fa4552295","year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.778660Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:858759ffd43090bf99dd5b5310c7a714c4c6ef62af1548e8126655d29316a155","observation_id":"40b42858-ba0f-4a7b-9fa0-e971e9b9fbf7","resolution":{"observed_at":"2026-08-12T00:50:39.775293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02361","last_updated":"2024-01-05T06:21:19Z","snapshot_observed_at":"2026-08-16T14:29:48.323460Z","submitted_at":"2024-01-04T17:00:49Z","title":"An Open and Comprehensive Pipeline for Unified Object Grounding and Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02361","snapshot_observed_at":"2026-08-12T00:50:38.784349Z","title":"An open and comprehensive pipeline for unified object grounding and detection.arXiv preprint arXiv:2401.02361, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.784349Z"},"links":{"cited_paper":"/paper/2401.02361","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:6d660f54504ceeec31d79ac4d39168dc10a4a1e7be82002ec3738c53d54719d9","observation_id":"33173060-5025-41e1-881b-8a7c7d4b9041","resolution":{"observed_at":"2026-08-12T00:50:38.784349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.750280Z","title":"Llmdet: Learning strong open-vocabulary object detectors under the supervision of large language models","venue":null,"work_id":"642643d4-882e-4fee-9b9c-a0698ee3a414","year":2025},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.789636Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:e16dd1507ee836d635d4c3e70170abcb329b8965aad522b60a8e7dd44ebf26f5","observation_id":"31b7c7f1-5b07-4da6-a806-cea59bd7fcfc","resolution":{"observed_at":"2026-08-12T00:50:39.757128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.795494Z","title":"General object foundation model for images and videos at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.795494Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:6aacbec4f38183871052ffd4b9f1bcc59579fac06d417ad4e830ed648091ed4f","observation_id":"a3b87be8-b678-47c9-b383-978b091bd266","resolution":{"observed_at":"2026-08-12T00:50:38.795494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.800990Z","title":"Generalized decoding for pixel, image, and language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.800990Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:1bf0e2e47947425e9be79301168b0cde182ccc5938b2e6b90e6a97493e258b14","observation_id":"de76a102-254c-4923-bf96-75629d0069b5","resolution":{"observed_at":"2026-08-12T00:50:38.800990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.805958Z","title":"A simple framework for open-vocabulary segmentation and detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.805958Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:31ba8cef62d0db6bf934d2efe422a9befe8b660fdd5ce1a8d0dfa0124da5cade","observation_id":"7746fd4f-a1ec-43c3-a507-0e0c2ba0844a","resolution":{"observed_at":"2026-08-12T00:50:38.805958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.682449Z","title":"Segment everything everywhere all at once","venue":null,"work_id":"e87da0b8-fa40-4fc7-933b-cf34d3ca6c13","year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.811376Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:ee5b89707e0fb31ebe4c3da024399d5b49ed5a9764d6ab5eb5e9302742734187","observation_id":"18d6d323-6993-4d3a-91ce-66b7c7f404d9","resolution":{"observed_at":"2026-08-12T00:50:39.689614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.05427","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.189017Z","title":"Open- worldsam: Extending sam2 for universal image segmentation with language prompts.arXiv preprint arXiv:2507.05427, 2025","venue":null,"work_id":"30325847-2226-4e4f-8bde-42388fa37613","year":2025},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.816000Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:6f76c493dc067f535e82cdf599d5b24ff9dbcd50df4d4a20651266aaf0fd7c83","observation_id":"61cbbf9c-bd7e-40c8-97a6-5cf21afd95ff","resolution":{"observed_at":"2026-08-12T00:50:39.199874Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.820534Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.820534Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:61f695f7e01987b3720cd4a8e0f647429b0ed48b308a1af060dd41aa2c8e6d87","observation_id":"8d45cf05-1f07-4640-89a8-b4f3cd67e6fc","resolution":{"observed_at":"2026-08-12T00:50:38.820534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04637","last_updated":"2023-07-06T16:55:36Z","snapshot_observed_at":"2026-08-16T15:25:44.387232Z","submitted_at":"2023-06-07T17:59:31Z","title":"Transformers as Statisticians: Provable In-Context Learning with In-Context Algorithm Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04637","snapshot_observed_at":"2026-08-12T00:50:38.824993Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.824993Z"},"links":{"cited_paper":"/paper/2306.04637","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:f2e2db2c0182aff168ca478128a875e383d51ec7e436df86b604856f2da22fbd","observation_id":"179f56a2-0934-43a0-b6ba-5795bb5577b5","resolution":{"observed_at":"2026-08-12T00:50:38.824993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-16T15:11:32.772599Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T00:50:38.830162Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.830162Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:2732d5652962bbcfee58a29235ee16326e3926365a3096cb38d32cde29759bbc","observation_id":"dcdd51bf-6c3a-4e16-a828-df52d40381e8","resolution":{"observed_at":"2026-08-12T00:50:38.830162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-16T14:31:04.236202Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-12T00:50:38.835625Z","title":"Lisa++: An improved baseline for reasoning segmentation with large language model.arXiv preprint arXiv:2312.17240, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.835625Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:5f665aeee6167cc43a3a04de5b15a37aba7382e9497c6ef4a59c327921f47d42","observation_id":"18dc40db-1ea0-41e8-8a1c-5957d02ea833","resolution":{"observed_at":"2026-08-12T00:50:38.835625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.840703Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.840703Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:6bf6fc7cebd0424643918f4f3d5e9f41c14625ad97093b72a7f3d59146a9af67","observation_id":"ed570fb5-ef30-44b7-a58f-822870c20593","resolution":{"observed_at":"2026-08-12T00:50:38.840703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.846502Z","title":"Pointrend: Image segmentation as rendering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.846502Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:e480bd567d86f38ef257178b6a1bd72f8632d2a775af1cada2aafc2c01a12934","observation_id":"aed20469-30a3-4f04-8de3-94dae3870694","resolution":{"observed_at":"2026-08-12T00:50:38.846502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.620272Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":"88815a63-dfd2-49f4-b139-f6d32ff46484","year":2016},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.851800Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:c94eef899dede0013b1ea92245aa602fbefa705c50859a1e2f07379b6c18ad95","observation_id":"c85a48fb-934a-4c15-b4c3-4c7c9819ac59","resolution":{"observed_at":"2026-08-12T00:50:39.625488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02589","last_updated":"2025-02-04T18:59:46Z","snapshot_observed_at":"2026-08-14T09:50:00.957608Z","submitted_at":"2025-02-04T18:59:46Z","title":"COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02589","snapshot_observed_at":"2026-08-12T00:50:38.856702Z","title":"Coconut-pancap: Joint panoptic segmentation and grounded captions for fine-grained understanding and generation.arXiv preprint arXiv:2502.02589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.856702Z"},"links":{"cited_paper":"/paper/2502.02589","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:72772f9a59ee6bd8d036c5c81c3cf86a882b0a3779eac8b94cf3a8ea170e1a20","observation_id":"6638bb39-258b-4120-8535-7e1d5ea2f75b","resolution":{"observed_at":"2026-08-12T00:50:38.856702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.862099Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.862099Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:83271366ebb0aae017e6c427149b055a324a991000da0493072890becddc1961","observation_id":"36661101-d3c1-4bae-80ee-34586aece948","resolution":{"observed_at":"2026-08-12T00:50:38.862099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.867594Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.867594Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:08c3f26476f860cc73a8f06babd2fd5f1f2e8dbf97888fe19e8bd7f85ec0374b","observation_id":"10385fd9-fdb0-4493-a342-4b2ea053479b","resolution":{"observed_at":"2026-08-12T00:50:38.867594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.577476Z","title":"Coconut: Modernizing coco segmentation","venue":null,"work_id":"4a55a90d-38b2-44a2-b6e2-abc1851b50e0","year":2024},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.873411Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:69e455328b5bd74f18490e56d6bd78ec39111d44a171f065e235db4ccf220f2c","observation_id":"66deab6a-78d7-4abc-8dcb-e8ae0b93c640","resolution":{"observed_at":"2026-08-12T00:50:39.583042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.560871Z","title":"High- quality entity segmentation","venue":null,"work_id":"402d05ac-8287-42d5-9867-7732d8f443d7","year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.879081Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:228882af9870222789ccd16163eb97e1ea38d57758a368b6450194170b9e87e1","observation_id":"1ede06cf-8bff-4a53-a624-56b8f28a7dca","resolution":{"observed_at":"2026-08-12T00:50:39.566011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.884016Z","title":"Semantic understanding of scenes through the ade20k dataset.International journal of computer vision, 127(3):302–321, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.884016Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:48ce12927dbd7177bc1b71ab9ed49ad602f395734403a12ef5ce80a49f05b246","observation_id":"88e66ab2-807d-44f6-90c5-0ff28ddb4407","resolution":{"observed_at":"2026-08-12T00:50:38.884016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16182","last_updated":"2023-12-24T15:13:10Z","snapshot_observed_at":"2026-08-16T15:04:31.998061Z","submitted_at":"2023-08-30T17:58:50Z","title":"GREC: Generalized Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16182","snapshot_observed_at":"2026-08-12T00:50:38.888934Z","title":"Grec: Generalized referring expression comprehension.arXiv preprint arXiv:2308.16182, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.888934Z"},"links":{"cited_paper":"/paper/2308.16182","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:319fef363949d55da5b17e5851df0d7e79faa6c83f6591eba54e7d3c99772314","observation_id":"173dff5c-6072-4a51-aab6-80fcf0136bba","resolution":{"observed_at":"2026-08-12T00:50:38.888934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:39.530405Z","title":"Introducing GPT-5.4","venue":null,"work_id":"54c1a918-ee0d-49e1-95a9-7562d46c4fcf","year":2026},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.894120Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:552b8bf457bc681644a8a4c50793c89a7bbb7a5ad3db092d6587b0b5aef346dd","observation_id":"23ee512f-4627-4f97-b5d8-1b16ba8376c4","resolution":{"observed_at":"2026-08-12T00:50:39.535906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.899194Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.899194Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:dd3be2c6e08ac2be9093390d5860503e8af89ad638e02dcad0420469fc022e80","observation_id":"dc15b24f-9320-4aac-810b-8490493cc188","resolution":{"observed_at":"2026-08-12T00:50:38.899194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:50:38.904354Z","title":"Roboflow100-vl: A multi-domain object detection benchmark for vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.904354Z"},"links":{"citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:173824d86b307ed81500a44a35deecbfe43fd9ae48b1c97868ff6f86947eac31","observation_id":"6932e29d-e9b6-4979-baf5-59e71b848e38","resolution":{"observed_at":"2026-08-12T00:50:38.904354Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T05:40:08.917787Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2608.07886."}