{"as_of":"2026-08-14T20:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e4c869f7e226abac98cb2697ac4467f30e37c74306bf1ab5ebff215be6566ab","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T01:31:57.305121Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.17950/citation-record","integrity":"/paper/2606.17950/integrity","json":"/paper/2606.17950/citation-record.json","paper":"/paper/2606.17950"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"A brief survey on recent advances in coreference resolution,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:a7575be25ef0113ee1930217292786355703ab6f4869a68030446ffabae5b048","observation_id":"f6aec185-b25b-4f91-bcc8-e04bc2677e3f","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Spanbert: Improving pre-training by representing and predicting spans,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:d01304580bfa9a13286c18d0f6f79c8815197cf681509b99eb17bcb12897f4ec","observation_id":"85df2914-b136-4958-9ced-fa899663cd65","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Coreference resolution without span representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:e47381aa7670ff5353f2417095266970637c77386d96523e8776f79005971519","observation_id":"a31a84b2-688e-47ea-b4ea-662f16acc808","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Image-based storytelling using deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:7b9f138a1316a120f48d5d82c100b4a698c905ff5fdf3df2e7fdb4a7890e0bff","observation_id":"850387c3-6d29-4d33-bfb8-7b8ab21b885b","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15714","last_updated":"2024-08-28T11:21:23Z","snapshot_observed_at":"2026-08-12T22:55:58.831899Z","submitted_at":"2024-08-28T11:21:23Z","title":"Pixels to Prose: Understanding the art of Image Captioning","version":1},"cited_work":{"arxiv_id":"2408.15714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15714","snapshot_observed_at":"2026-07-03T20:18:56.179978Z","title":"Pixels to prose: Understanding the art of image captioning,","venue":null,"work_id":"60c961f5-dccc-4fcf-ba5e-4c6da8fa4b55","year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"cited_paper":"/paper/2408.15714","citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:482170476ab1737da76ee539ae3bf1e31c9c5454cdca437638834bdd854e9f86","observation_id":"d4396c91-40ec-4091-adef-3d11a698491f","resolution":{"observed_at":"2026-07-03T20:18:56.183301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Multi-modal self- perception enhanced large language model for 3d region-of-interest captioning with limited data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:31ac6b893b57a2bde6386e0e89f452b83af208d88c5f01c61816824231044562","observation_id":"eff252fb-d3a3-4f73-8611-6927cd49c3a8","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Video storytelling: Textual summaries for events,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:622035925c6ae68d6c8b3359b5c2968db877600cd685cf34e860b3757e45d17e","observation_id":"946e652e-70b1-46cb-8d1a-ab71707412e1","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"What are you talking about? text-to-image coreference,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:7d886f84b2f022d14175fad06d115f7a3242fd2311913fa505078b9ae7e99500","observation_id":"555f3015-43d7-4709-b37a-37d812054670","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Who’s waldo? linking people across text and images,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:e649746ddca715a83a51db12f053956d5fc352f16258766002a6b5c8f4afacd4","observation_id":"2807f6fa-1704-426f-a6e0-ea071d08f41c","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Phrase decoupling cross-modal hierarchical matching and progressive position correction for visual grounding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:c68b0bbe26c10a18f2f0d7fc5dbb985b8e352159d8153589c6da5f93c1d98de5","observation_id":"17a15f9a-450f-4656-801c-27edd7bf10da","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Gravl-bert: Graphical visual-linguistic representations for multimodal coreference resolution,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:d6201642d25e93de220a1e524adb08a3675f44f60bfc6c2f7188aa7fc165cab4","observation_id":"a9bbb425-810e-4f35-b1be-6a430b9c7c24","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Reclip: A strong zero-shot baseline for referring ex- pression comprehension,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:4318012818dceaf6210dfb4833003737e5096da5af609bae4339b62bca6f3f16","observation_id":"8e98a0a0-0712-4d37-ad1b-f0f5c0cc5040","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"A dual reinforcement learning framework for weakly supervised phrase grounding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:e9dfd26feb206b019cf23a9ae314faa634b7ce1274d7bcf1b0f0efde112e7cc7","observation_id":"c5c131b2-2ba4-4571-99fc-b33879a2f4ad","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08667","last_updated":"2021-10-20T23:42:35Z","snapshot_observed_at":"2026-08-13T19:38:07.244753Z","submitted_at":"2021-04-18T00:14:29Z","title":"SIMMC 2.0: A Task-oriented Dialog Dataset for Immersive Multimodal Conversations","version":2},"cited_work":{"arxiv_id":"2104.08667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08667","snapshot_observed_at":"2026-07-03T20:18:56.185362Z","title":"Simmc 2.0: A task-oriented dialog dataset for immersive multimodal conversations,","venue":null,"work_id":"90277a98-3fd1-4c7c-8f3a-3f55079a05f2","year":2021},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"cited_paper":"/paper/2104.08667","citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:1c96f36e04d083327ee853b18184bb35132808bb670e4f12fe53398d8f1559b6","observation_id":"a27f7227-b67a-48be-b9df-8caccb5b8f4c","resolution":{"observed_at":"2026-07-03T20:18:56.188183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Who are you referring to? coreference resolution in image narrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:f076787c44d5f59d8e3184184bc6fba375341327b56aa9fbcf90045667c9fe50","observation_id":"1e16611c-1532-4682-8064-eb4fcd494130","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Semi-supervised multimodal coreference resolution in image narrations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:4da6c63d3fc1471a7e774cef047874ed91409738f5bafbbd50501ed6974813a0","observation_id":"09b744ce-c4bc-45c9-b468-ec84a428527c","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Self-adaptive fine-grained multi-modal data augmentation for semi- supervised multi-modal coreference resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:14a0e3e622127bfc0ab28486e58527353e3e8a0a2fe27a24d2ac37aa73d72162","observation_id":"509bbd06-83e0-482d-ad73-89b6aeb0f725","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Connecting vision and language with localized narratives,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:be53a84a5fb0e42025f9bc94f3344fcde44c3c719f46d7c35da293735ee6cb01","observation_id":"6b7ff081-24b2-49b3-a784-00923daa2c51","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Revisiting multi-modal llm evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:8ecd1963ee86ace02f9172b2d445afcd3297dabac8e5fe57752fd02d17e8ed28","observation_id":"1f4e2554-510b-40e0-8ae4-400add9bc2d8","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Knowledge en- hanced vision and language model for multi-modal fake news detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:68aad8bb02143619c66898bb911fdf5519d4bd35367130418216b14d7a8c14c3","observation_id":"867e7710-eb73-4689-8348-a626bab1c6c9","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:56e00639c58e2021c3e3a2f4d8c9afaeea3e4abe2bd918e52f8078b866e570e1","observation_id":"56c5aacc-e456-4b35-b0ee-8e77c2f4ad4f","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Combination of evidence in dempster-shafer theory,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:f06249ed233b84b2520b153724eede1fc3938ae920437d3d4f463084083e85a4","observation_id":"278aa20a-41bc-4d50-9e80-329fdbd20c73","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Jøsang,Subjective logic","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:01be8fae7312220e08ee69c327a64104a583ce10a66e5841f75e2dafcff1b14b","observation_id":"5d3329ff-afd0-4993-82f1-b270371fdb29","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":"1908.03557","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-07-04T09:09:43.648844Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","venue":"cs.CV","work_id":"5a9f7670-5c21-4203-8fe1-cc6eb9bc26d5","year":2019},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:cd785274970abc9655b403e3dae0a3b4394568a4ea5112bb96521a61f4de1a1d","observation_id":"667bb99f-0cda-462e-b6c2-d0afa9091719","resolution":{"observed_at":"2026-07-03T20:18:56.173941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Uniter: Universal image-text representation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:6e6080bfca6b5fc55fdb0a63593556b8cc730e69d7ffa624a3bc1623a12c3f36","observation_id":"0546ca64-1e77-49a3-8f75-ba137caf22c9","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Vinvl: Revisiting visual representations in vision-language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:475d3ea0fd6b7edca5460f978c6266046a5f2a3a19650c052cf741e75538ae05","observation_id":"38262897-86ce-46b6-9885-bcdadf8caa1d","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Zero-shot referring expression comprehension via structural similarity between images and captions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:835adf2256d05dacb20cc80405cf83548cc887fe3386ae496af61f8f55a80795","observation_id":"04150a8a-f231-4ead-8e04-b590f669c5be","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Models overview - anthropic,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:bbc14038fe5ff16cd931e551d146b8da4b3fb91d59a723597ec7806e119d7268","observation_id":"f513a35c-8d74-4331-b43f-b26c316a00cf","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:7637399d19e3a41d3ebb7eaa255dd4e20b504ca0a35f5c9b83c58909c5bb00af","observation_id":"623531fa-1347-47e2-96a1-04176796b4ae","resolution":{"observed_at":"2026-07-03T20:18:56.170496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:b277696bb364ef6c2f677c1b9912ece065cb8963993a9f768dad8f3a314cc3a5","observation_id":"ace29cde-5c94-4311-a78c-25e43e5dc1ac","resolution":{"observed_at":"2026-07-03T20:18:56.178490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09909","last_updated":"2023-12-04T14:13:35Z","snapshot_observed_at":"2026-08-13T14:45:20.355992Z","submitted_at":"2023-10-15T18:32:27Z","title":"Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis","version":3},"cited_work":{"arxiv_id":"2310.09909","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.09909","snapshot_observed_at":"2026-07-03T20:18:56.190358Z","title":"Can gpt-4v (ision) serve medical applications? case studies on gpt-4v for multimodal medical diagnosis,","venue":null,"work_id":"8eff5e6c-f70f-425a-9e22-2e7a8b877085","year":2023},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"cited_paper":"/paper/2310.09909","citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:bc9ef5d812af4f5213c1f0fbade95bf029899cc3b41122366b7ae3b49b1b0f24","observation_id":"629cdee8-bbec-4051-9148-4e44353cf548","resolution":{"observed_at":"2026-07-03T20:18:56.192887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Gpt-4 in a cancer center—institute-wide deployment challenges and lessons learned,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:bb3465cd653780ec1bf91f0e4ab354c2f40a4d228711971ea9d3ea5a4ddc74aa","observation_id":"6b19fbf8-9d5d-418d-b852-c6dd7605ee67","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"3ur-llm: An end- to-end multimodal large language model for 3d scene understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:4479dffb0a6553f3a9e416cc1276e9ee41c81ad9ee12e2256e674288beda01da","observation_id":"adb664dc-0067-47d6-9dfc-1fc49d468276","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Hico: A benchmark for recognizing human-object interactions in images,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:f694cc9b399fc697f4588c0b1e11dd699511b7d2821d56f5088b64f591362b71","observation_id":"8ffef104-def1-4c78-8eaf-baa8c44082ed","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Grounded situation recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:54efd63e9e393b83a306efba690cb181df2010313c30408c696e1cab631f7218","observation_id":"0c1bef65-9301-4302-b3c6-0905ea8db195","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:33dd9a40f17ef2ac64558b669009ed0693f8d6fdd21bfe36cf68146816e90804","observation_id":"e12077cd-102e-4813-b29f-e1f7e7684bd6","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:5b83c4f48c67525a9ed5d810ae5ea7e44c0029e15277ece4513bc8a0ff04835d","observation_id":"359709fc-ac16-4a5a-99bd-7bb25953baf5","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Classification-then- grounding: Reformulating video scene graphs as temporal bipartite graphs,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:25cebe545d1c1ca9df3647fca0f1f7e6c104e8dbd5e816abc3db3cd05f89e149","observation_id":"761881ae-d35e-4327-86b5-74ecc1ad6af2","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Llm meets scene graph: Can large language models understand and generate scene graphs? a benchmark and empirical study,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:d61608f3c4f5a80672dae49e016ed1db83ea0e03e1e52a69136e02650c1b17e5","observation_id":"bf512b9b-a2be-4660-b2b7-2fd03e307c04","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Information extraction,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:20da0cb6a9473dbac9981ef4bae7130b431552ae998852a55b4671450c06e61c","observation_id":"ddfa099e-bf33-4c02-ad0a-b1a195d30443","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11644","last_updated":"2023-10-18T01:06:01Z","snapshot_observed_at":"2026-08-13T05:47:12.910437Z","submitted_at":"2023-10-18T01:06:01Z","title":"Open Information Extraction: A Review of Baseline Techniques, Approaches, and Applications","version":1},"cited_work":{"arxiv_id":"2310.11644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.11644","snapshot_observed_at":"2026-07-03T20:18:56.198254Z","title":"Open information extraction: A review of baseline techniques, approaches, and applications,","venue":null,"work_id":"74717114-07d3-4bc5-8ec5-3979a6a6ba51","year":2023},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"cited_paper":"/paper/2310.11644","citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:f2d5a35602623b0260a2f50d188926917eaad92820f05f1f2d1a07e079efab2a","observation_id":"5ad7fd5a-5d45-4ac9-9ca9-b470c766a780","resolution":{"observed_at":"2026-07-03T20:18:56.200198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:6337152e946db2849762e18d6ab69fe9f36d037dcde050eaa66409518d628737","observation_id":"d02f59e3-f637-4adf-bccf-9b2b47ff3c94","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Generalization of dempster–shafer theory: A complex mass function,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:bee1b8bcf361f729bc73d6e71f8b573ca2fc05839a6f1ab1027f984782cea07c","observation_id":"b4ef7bb9-c672-4f0e-9c8b-610710db22f3","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Trusted multi-view classi- fication with dynamic evidential fusion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:e4972fd1b0ca1239d24ce2cdea1a45a036a48adb128b46c3ca9ca6aa1109bcbc","observation_id":"294ef122-8948-4746-bb81-e5131748bd7b","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07983","last_updated":"2025-04-16T10:50:18Z","snapshot_observed_at":"2026-08-13T00:32:26.842527Z","submitted_at":"2024-04-11T17:58:06Z","title":"Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2404.07983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.07983","snapshot_observed_at":"2026-07-03T20:18:56.194117Z","title":"Two effects, one trigger: on the modality gap, object bias, and information imbalance in contrastive vision-language representation learning","venue":null,"work_id":"dcda454e-6c30-463e-aa09-77c447834e4c","year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"cited_paper":"/paper/2404.07983","citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:e9b6252147bb6583519a84e102e1e0617c128f41fa22acc28a231cc478058628","observation_id":"05a2ecf6-785e-4c8d-93df-da99bba02c73","resolution":{"observed_at":"2026-07-03T20:18:56.196361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Bridge the modality and capability gaps in vision-language model selection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:e36d914fb910be563f1bee3b8e6309601729c95eeb449c0c88492f8b49de163c","observation_id":"e05d12df-0c03-4eb4-b27f-40ccdf1d9543","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Towards under- standing the modality gap in clip,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:93f7d4ad6c53c8ee392d38515660bd0d25855f036fdcfed16b7cc0a20f8ba070","observation_id":"cf64065c-2d07-49e6-a035-3f61b046533e","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Confidence- aware contrastive learning for selective classification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:a568c620ad80a5ab851ad6674f026bb7583cdf43b5ef2eef9f00645e8d2f4b80","observation_id":"4649ff1e-7a89-4042-bc86-485c1198a877","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"On calibration of modern neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:fc29127dfce359217708122d9c91ec4906ebc8e75df5d22c3d73a864f1881145","observation_id":"94524f7f-cad4-40ec-80e1-a53a97a51048","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Overview of results of the muc-6 evaluation,","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:32fe6f9768b19e669625ea4d751742c0ae660b1e4950fc5c8728e413f8f1afe2","observation_id":"3985df82-0674-4456-b182-22880d3916ab","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Algorithms for scoring coreference chains,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:f48424cefd4013d6d091f6a76f62a3e934f482da61d75b1babe31006835f5048","observation_id":"94687791-a189-472a-b2f6-2513d944448a","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"On coreference resolution performance metrics,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:39b825666271fb8b98928d7add37e0068bb45907a49df39a05dd5ed77809d4ea","observation_id":"a545e5a8-468d-45f1-9869-4b80637f748a","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Conll- 2012 shared task: Modeling multilingual unrestricted coreference in ontonotes,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:fae2b9b8f43dcd2336b143a8225d38c94607dd708a4eec5b0856bffa076ffb34","observation_id":"540d48fd-6d2e-4879-9c2a-824318456aa7","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Stanford’s multi-pass sieve coreference resolution system at the conll-2011 shared task,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:b2513c68296d83e8bfa1c2a22d2d675bffdd572e17e627984665640677fdaed0","observation_id":"d49a025f-ec5c-4fff-aede-4a4c4994262e","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"End-to-end neural coreference resolution,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:d781e7e7ef1779a400e3acef01c56611c5326f80839bd812534f7098d0e3d50e","observation_id":"4557615b-2d90-4143-8ef9-3ec372b114e0","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"On gen- eralization in coreference resolution,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:b887481716d9d1c14962134a1a5323c80a3af2b5eb35a14a8648b6a1df95ed1c","observation_id":"71694848-dfec-4640-80e3-71e6e6c82ae3","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:ef3677d8a88a51ae2df362addcc184173b98ff9b48aebff6568403f3c8884237","observation_id":"aa34f6ed-e795-4aa1-9565-e073481cc37b","resolution":{"observed_at":"2026-07-03T20:18:56.167500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Maf: Multimodal alignment framework for weakly-supervised phrase grounding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:c83d9ebe7b73c00c8276194c6f5a61fc6d121ad8df22e7eae10aa696086d9c90","observation_id":"2cbf12cc-a88f-4bf8-b086-e8d05fac0e37","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Are language models robust coreference resolvers?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:9af57605f18ab197281237e46a4f7be16aed93ecdb1e47ed51dba3c58e6d006f","observation_id":"76493984-ff25-4a23-8a76-0c0f91d1fccc","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"Open information extraction via chunks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:4216b4e142bc24367f5527883fccfb7a9ad5dd34dc64b4d0be87c051b48beba2","observation_id":"f3bc6d5b-6506-4b50-9d55-8b5cf8bddcad","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T01:31:57.305121Z","title":"From recognition to cogni- tion: Visual commonsense reasoning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T01:31:57.305121Z"},"links":{"citing_paper":"/paper/2606.17950"},"observation_digest":"sha256:703ba49d2fc8d40866c1fff17f8954739b2e52014c97e5854c31b59a3334ecdb","observation_id":"580a7e07-7997-4065-9078-2ab778e90217","resolution":{"observed_at":"2026-06-27T01:31:57.305121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.17950","last_updated":"2026-06-16T14:04:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T14:04:13Z","title":"Plug-and-Adapt: Multimodal Coreference Resolution at First Sight with a Pretrained Alignment Model"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2606.17950."}