{"as_of":"2026-08-22T05:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a95de906f38bf8792b7986d42654c2583190411ae72c275b5ad14ddb60954031","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:16:58.956248Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T15:35:30.549656Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T15:36:33.974443Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"cited_work":{"arxiv_id":"2505.13788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13788","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ground-v: Teaching vlms to ground complex instruc- tions in pixels","venue":null,"work_id":"bc1876d6-c6e5-472d-a1c8-745c7285cc05","year":2025},"citing_paper":{"arxiv_id":"2509.13484","last_updated":"2026-01-15T21:33:56Z","snapshot_observed_at":"2026-08-18T08:18:27.337934Z","submitted_at":"2025-09-16T19:31:40Z","title":"MINGLE: VLMs for Semantically Complex Region Detection in Urban Scenes","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T15:35:30.549656Z"},"links":{"cited_paper":"/paper/2505.13788","citing_paper":"/paper/2509.13484"},"observation_digest":"sha256:4b5731b5427ae592801deebf3ef66a7e9c299bbeb37daf4b16cdf7e4a5595274","observation_id":"dd59e59a-2026-4416-91d0-e3cdf7aa25c2","resolution":{"observed_at":"2026-05-18T15:36:33.976759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13788/citation-record","integrity":"/paper/2505.13788/integrity","json":"/paper/2505.13788/citation-record.json","paper":"/paper/2505.13788"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T20:16:58.696252Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.696252Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:bb7f9cd69f4d911792dfdb049bb32c76b6fce4cb94089f20785076aa739563ce","observation_id":"09dd84bc-e99a-4a68-a73f-d66b0237e582","resolution":{"observed_at":"2026-08-15T20:16:58.696252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.870436Z","title":"Language models are few-shot learners.Advances in Neural Information Process- ing Systems, 2020","venue":null,"work_id":"6b4ff559-9e27-498c-8e20-24ace110d11f","year":2020},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.701203Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:cd8d413c77edfe9e345cb5dd9aff529a56411748ea8335b57449a98543e1a4cc","observation_id":"1d63c4fd-c8bb-4d54-9981-0daeaea3f22b","resolution":{"observed_at":"2026-08-15T20:16:59.874434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.857737Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":"bc4213ff-0457-43b1-a91c-94d45adabda6","year":2018},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.704746Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:2ac53421b6f93cb70829ec8aaa9cbf55b8fb93288fa7457d95599d230f0e98f2","observation_id":"416fac4e-da57-43a9-a434-2ea8d99542e1","resolution":{"observed_at":"2026-08-15T20:16:59.862042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.846206Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"5242d00b-f35f-47bc-b2d5-70fa782e90db","year":2022},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.708662Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:f8ff7ffc43698f0479543cf6d5ea6e093d5a543cf652aef853ac79fb6f67966f","observation_id":"7f1fb598-e667-4965-96d5-90d1ea1ba6b6","resolution":{"observed_at":"2026-08-15T20:16:59.850081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.712543Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.712543Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:efbabb152226043be314528fa76d76ac9095a5996c5d75a2b5306cda834bf95d","observation_id":"d15ef60e-8dbe-4eac-a076-3ddc0df88d7b","resolution":{"observed_at":"2026-08-15T20:16:58.712543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.716142Z","title":"Scaling instruction- finetuned language models.Journal of Machine Learning Research, 25(70):1–53, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.716142Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:25be45348821038090170041f614e37538060dcd90f6cefdd66ab277199239c2","observation_id":"e51618ff-1578-4644-8119-2a7b89ab50d2","resolution":{"observed_at":"2026-08-15T20:16:58.716142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.816753Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"01a9b33a-3077-4cb7-8541-f71e842b13da","year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.720068Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:12054cf1c6b6235183e1eeb65c237e87c0848bcb5ffe2c4536dd2e8b317a5976","observation_id":"d92fd4bc-b7b4-4111-b98f-3405b708bcf1","resolution":{"observed_at":"2026-08-15T20:16:59.821046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.723426Z","title":"Vision-language transformer and query generation for refer- ring segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.723426Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:65ec923bf9269498edb57a3499874dc1e0cfd1b7b32bee798764a88e7edea20f","observation_id":"eae0eda7-602a-4faa-b29d-c3e25a17db16","resolution":{"observed_at":"2026-08-15T20:16:58.723426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.792177Z","title":"Segnext: Rethink- ing convolutional attention design for semantic segmenta- tion.Advances in Neural Information Processing Systems, 35:1140–1156, 2022","venue":null,"work_id":"2369f02a-d2eb-4ab3-a65f-1f22104c0d14","year":2022},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.727483Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:432efa81aaa69e644112cbff2b9e4f9e286c237b4a7d9a7764b857078f2e5cd3","observation_id":"1a74056c-a561-4845-b66e-2be5685b0bd3","resolution":{"observed_at":"2026-08-15T20:16:59.797079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.731677Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.731677Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:bddd4756fc9dfa36a77c9ba3f80aec0dd2e75795fcca17858d054b9ee474769b","observation_id":"19ebaaa3-2ff0-4877-9359-db185a155d36","resolution":{"observed_at":"2026-08-15T20:16:58.731677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.765791Z","title":"Partimagenet: A large, high- quality dataset of parts","venue":null,"work_id":"5b095d60-8376-40f2-8017-306faf7f2d9d","year":2022},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.735359Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:2eeb7ef5b9c898585a767b5630a0bab30fe43af1b4774e65d39d87f49bd0e0c6","observation_id":"bcf17a96-50ac-4f76-864f-71763da138fc","resolution":{"observed_at":"2026-08-15T20:16:59.770700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.752048Z","title":"Segment any- thing","venue":null,"work_id":"e42d2de3-8945-4d7f-880a-32e94af79908","year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.738830Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:5958515e9dda4d4779c995d5cd37493953b7daf869a0c4dc7a5e0429a59f04e2","observation_id":"7df6b6c8-d999-4f66-a59a-7899d8d1774f","resolution":{"observed_at":"2026-08-15T20:16:59.756055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.737056Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"1059ff6e-80b4-40dc-9922-6982cb6a9251","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.742999Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:92d5a856dfa1c0f5c7285b3256318548642055745d3ce4abd3db80ac41430379","observation_id":"863d9aef-d4b2-41dc-8ace-95a32f96da2c","resolution":{"observed_at":"2026-08-15T20:16:59.742348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.746568Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.746568Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:1e67985cacc80b1845135a42116a401ee0f258b6234d6b551d46d4d176a384e9","observation_id":"4e75f98f-0b70-4022-bfb4-3e0cf84c6352","resolution":{"observed_at":"2026-08-15T20:16:58.746568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-15T20:16:58.749931Z","title":"Textbooks are all you need ii: phi-1.5 technical report.arXiv preprint arXiv:2309.05463, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.749931Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:56bbad358be65a74642e5f048523ceaf0cd7856402cc2c2defb9641f7d97d79c","observation_id":"73940d01-5787-4bff-85ea-6ef3212882e1","resolution":{"observed_at":"2026-08-15T20:16:58.749931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-15T20:16:58.753702Z","title":"Evaluating object hallucina- tion in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.753702Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:e69fdb7ea323b227bc60ced8a9a5fb3ba475ea6e20eb806b5cfef3d479711c45","observation_id":"a1633b25-78a9-4ad0-80da-509e450d59a6","resolution":{"observed_at":"2026-08-15T20:16:58.753702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.716789Z","title":"A real-time cross-modality correlation fil- tering method for referring expression comprehension","venue":null,"work_id":"a6e1a44c-f199-408a-b981-05b5c2744c4b","year":2020},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.758472Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:410ccfe4046a2e3d0b499d2d9ce055d7dfa91225133566e327919a8ec8a86aa1","observation_id":"67cc99a7-b38e-4e55-a6be-e8572b9dcf5c","resolution":{"observed_at":"2026-08-15T20:16:59.720683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.705452Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"84706af6-b4c2-477d-8459-411d5b79a9ee","year":2014},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.762633Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:73deb9323101bdbe99a8fab1fc33ee7609050f9e972ac582a5edf419a26ada55","observation_id":"5ddddb08-c1a1-4a0f-bef9-93f07c7bac04","resolution":{"observed_at":"2026-08-15T20:16:59.709218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.693611Z","title":"Gres: Gen- eralized referring expression segmentation","venue":null,"work_id":"e1d07ed6-7229-415b-880e-79a9927ecbcf","year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.766544Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:4aeaf71be1367a61e4061873f49dcaf9499c706e6d7c2b540e8ba408795f367f","observation_id":"9a237f9f-98aa-47a7-badc-941bc952a127","resolution":{"observed_at":"2026-08-15T20:16:59.697485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.680350Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2023","venue":null,"work_id":"73c2daa6-1273-47b1-ac87-200fbf669541","year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.770043Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:3ab72e6a4be9f0a10b98adf700f7f0c4063847c20b334274acc2a1d9ba820eda","observation_id":"1d092265-6276-44b7-b4fb-6e48a3f90470","resolution":{"observed_at":"2026-08-15T20:16:59.684592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.774321Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.774321Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:05efbaf03b95d721e11f0f1d6d0af986dd5550d5c254fb00626c962f05a060e4","observation_id":"eff0206e-393d-4f22-9c06-8c4144e9c8c2","resolution":{"observed_at":"2026-08-15T20:16:58.774321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.659125Z","title":"Poly- former: Referring image segmentation as sequential poly- gon generation","venue":null,"work_id":"effb942f-7cce-47b8-a142-6ffda57b9066","year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.778285Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:81fd78e1c63efc19f03f1e9009ffc5eb8d3674a7a00d5fde98715cd9427690d6","observation_id":"74ac52eb-a070-47db-b1c5-8beb11a367c3","resolution":{"observed_at":"2026-08-15T20:16:59.663132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.647390Z","title":"Grounding dino: Marry- ing dino with grounded pre-training for open-set object de- tection.ECCV, 2024","venue":null,"work_id":"1b26e396-ba4e-44f2-b68b-934954f4ee0c","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.782236Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:8a41058c1b392fffaed450943616013a306f8610aeb5d1bff8af4796bed4d696","observation_id":"68b6d641-7668-4151-ad63-7a44f01197ef","resolution":{"observed_at":"2026-08-15T20:16:59.651654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.786078Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vi- sion, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.786078Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:fa481c3814bd6303a9612f8f559e5590af600992ce05db963181d8de2409b8e6","observation_id":"aa706191-db2f-45c3-9bbd-aa5100824b10","resolution":{"observed_at":"2026-08-15T20:16:58.786078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.789570Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.789570Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:0991d58fbff393edda2bfe460cb9f90216b4864908bcb47519f5ade9f50db8ce","observation_id":"638043a9-af16-4de3-bc14-354e29fa3d0a","resolution":{"observed_at":"2026-08-15T20:16:58.789570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.792872Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.792872Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:966f70d1deb18cf2c9a13284950249303f7a6e5cfb1fb5786f3d2dedd8c34873","observation_id":"0591ee7d-26c4-4864-a719-bf7a4e449334","resolution":{"observed_at":"2026-08-15T20:16:58.792872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.796858Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.796858Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:12b5ad975cf04969cc16d1747ec3aee1ebf800f2ed98e8cbd61697889ea56417","observation_id":"0f545b85-dd49-4eb7-baa9-9a7fef71fbe3","resolution":{"observed_at":"2026-08-15T20:16:58.796858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.601154Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"c1c244f2-abd1-4f8a-b797-c7fcc22a24e7","year":2016},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.801387Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:956e4230c6046e5ec168e6a641ad966c1a1d04ea7e2c3fb5ee7b8d0668ae0cf6","observation_id":"495f148b-aaee-47c4-975a-2dc6b11ac49c","resolution":{"observed_at":"2026-08-15T20:16:59.604971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.585438Z","title":"Mod- eling context between objects for referring expression under- standing","venue":null,"work_id":"2e3a7dd7-fda9-4341-b5da-972e9d933f9e","year":2016},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.805957Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:0cac55f4ce507a9bcdb2cbfe1d0bc9be7e7fd61fd3f25189f120430619f07599","observation_id":"c378a0cd-837e-4a34-8ecf-503387121e27","resolution":{"observed_at":"2026-08-15T20:16:59.589914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.571034Z","title":"Ground- ing multimodal large language models to the world","venue":null,"work_id":"d2d63a5c-af8d-4488-9e42-090a215d2804","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.810397Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:39265527738cecbcb839ea18125cb7f39badb20ad01ef07e287f7c32f0749e74","observation_id":"d104872e-ec82-4836-94c7-a272f73ef646","resolution":{"observed_at":"2026-08-15T20:16:59.574831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.558965Z","title":"Perceptiongpt: Effectively fusing visual perception into llm","venue":null,"work_id":"4a711375-df85-4b85-85c1-20dc2bff4a86","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.815076Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:380b2458092f9059ad99709b712a5d4cd06abe0ce6efd2258eaf0f6ac7c86e13","observation_id":"92b54a11-894e-4f1e-8fb4-b30f3ffc4db1","resolution":{"observed_at":"2026-08-15T20:16:59.562430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.818976Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.818976Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:f30d62b26edd0bceabe4e65b2abe0a333a0c4b9ab2e4ab764f802e2e563d6516","observation_id":"96ad3284-1722-4692-a652-f040e8780eb8","resolution":{"observed_at":"2026-08-15T20:16:58.818976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-18T12:32:09.276205Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-15T20:16:58.822948Z","title":"Vision language models are blind.arXiv preprint arXiv:2407.06581, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.822948Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:42f924b171b0adac61e86a3ec36dcd5f1ef28b51d6bfadd9b9f68b548c12b0b1","observation_id":"78df9661-6317-4dbe-a284-58cccc982189","resolution":{"observed_at":"2026-08-15T20:16:58.822948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.539830Z","title":"Paco: Parts and attributes of common objects","venue":null,"work_id":"3d013638-670c-400e-b10a-54bd0ff26ded","year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.828087Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:b5afa6f8913b9a9a9431aa52960d876500fcde85138026e40f905204bf0981c1","observation_id":"17f95633-155f-4e49-ada9-1bd882e23a5d","resolution":{"observed_at":"2026-08-15T20:16:59.543849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.527499Z","title":"Learning to lo- calize objects improves spatial reasoning in visual-llms","venue":null,"work_id":"ff1459e4-2d7e-4cd8-aba8-4aad1a579bf8","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.831770Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:a328bfa2e7fc9bd3b60489f3a848dafe3c7d85c6ee8a81f87beaa764b5dd5f3d","observation_id":"85722242-5d7a-4c35-80c8-adf3ab1399b0","resolution":{"observed_at":"2026-08-15T20:16:59.531877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.511740Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"68c75fcf-c7e2-417d-9210-4d31a40ddd4c","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.835127Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:98d280265c954cc25fcdc9c30488af8de34ff2394faf86f93d95b2d57e7d17d2","observation_id":"40476545-e1db-4d61-892a-86128a5eefaa","resolution":{"observed_at":"2026-08-15T20:16:59.517584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.838824Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.838824Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:2b583e3008dedb88fd9e86ca4aab94337d22dd05fbc05280b707a86d1ba24e97","observation_id":"632b7d50-0e95-40e9-a834-df1fcc34cd57","resolution":{"observed_at":"2026-08-15T20:16:58.838824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-15T20:16:58.842906Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks.arXiv preprint arXiv:2401.14159,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.842906Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:10cc331b976daf212bc2f81c71cc3c515f86d68d8bcbcb9358c0379148e36e33","observation_id":"b14ef63e-4cde-4dda-8c67-a8806a6a8a8f","resolution":{"observed_at":"2026-08-15T20:16:58.842906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.484837Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"498468d5-2ced-4b2c-ab51-7099b2111051","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.847087Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:fbfd171672857f8f6aa70931d94928a0b03de07fa3151b7d89254e54f46fd610","observation_id":"6239ae00-5d23-438b-9e9f-3772eb0f898a","resolution":{"observed_at":"2026-08-15T20:16:59.488989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.470442Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"f531372d-719d-49a4-bbce-28eea44f7ead","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.850767Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:9942410bb0d9084be5c47f3ef633941807c72c216b99b3e84cec849f6106bd39","observation_id":"9ef68c60-9c4e-4480-86bc-f34013e8b54c","resolution":{"observed_at":"2026-08-15T20:16:59.475176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T20:16:58.854060Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.854060Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:ee829b052251019cb9654514316e2c479dfdfc812da45ac8812115a5a2d526c9","observation_id":"9a2f73ce-5b07-436c-8fa0-a10b80332c85","resolution":{"observed_at":"2026-08-15T20:16:58.854060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.459257Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":"1f683dd3-28f2-4bf5-a2f8-097f9bf6fdce","year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.857631Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:5ff783157ec3f1cf48aa470dcf6c9dc8b4075515ad36f8f231b6c9141f14d30b","observation_id":"40b701da-635c-447a-8df8-cb0280a26aa2","resolution":{"observed_at":"2026-08-15T20:16:59.463018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:58.861352Z","title":"Cris: Clip- driven referring image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.861352Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:731e00b3f7975dd6578b748a55bdd44cb1bd011fb3f4a7c697863439d733e9bc","observation_id":"ca5d86b8-6261-4551-b0ac-0113d0e813f6","resolution":{"observed_at":"2026-08-15T20:16:58.861352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.440719Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"0cbc88e3-ca0a-47a8-befd-33b1509cea25","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.865422Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:635ecc6d188c27b0435478ea3c48998b23c7a2d5248fdaeee7c1dd3c1b5883f4","observation_id":"f65f6d2a-5017-4d8f-8ad6-a08bb3345e3c","resolution":{"observed_at":"2026-08-15T20:16:59.444246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.425373Z","title":"Described object detection: Liberating ob- ject detection with flexible expressions.Advances in Neural Information Processing Systems, 36, 2023","venue":null,"work_id":"78254077-8f58-4401-9ed5-ea9a03ba4782","year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.869287Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:c1c040b18bf925b8ec9111c6d16a2a906e6021ad8a89ebf6f7cea7d82c973555","observation_id":"49981b7a-c443-49b5-8d62-85ba87fb1b9f","resolution":{"observed_at":"2026-08-15T20:16:59.430194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05348","last_updated":"2024-08-28T14:26:07Z","snapshot_observed_at":"2026-08-16T14:44:40.421382Z","submitted_at":"2023-11-09T13:18:27Z","title":"u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05348","snapshot_observed_at":"2026-08-15T20:16:58.873253Z","title":"u-llava: Unifying multi- modal tasks via large language model.arXiv preprint arXiv:2311.05348, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.873253Z"},"links":{"cited_paper":"/paper/2311.05348","citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:fc89c34b26bed3938b6371472e8491846c4a574fa14e6e71ab1ad351a3c19061","observation_id":"bf6f09e9-e25a-4ad4-a635-392d2d4b58c6","resolution":{"observed_at":"2026-08-15T20:16:58.873253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.410897Z","title":"Universal instance percep- tion as object discovery and retrieval","venue":null,"work_id":"be1c1fdb-551f-4f01-808c-e24a14979790","year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.877275Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:920e9c88773e428e8ebe2873a30ffd9c555299113421637db09322ca25fb40a2","observation_id":"4a11fe01-d78f-439a-a348-5c2bcc1770d3","resolution":{"observed_at":"2026-08-15T20:16:59.416560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.394524Z","title":"Lavt: Language-aware vision transformer for referring image segmentation","venue":null,"work_id":"19485d98-0c7d-48bc-b5a2-8f34e28eb3f4","year":2022},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.881501Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:ccd3788bde322281c73b607fa0950a843b574af40a2543186e1c7eaab3a93955","observation_id":"c0f872fa-63cf-4518-87fe-a4e545761500","resolution":{"observed_at":"2026-08-15T20:16:59.398952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.379075Z","title":"Cross-modal self-attention network for referring image seg- mentation","venue":null,"work_id":"20193a5d-fca8-4c48-aa77-a422730a2c03","year":2019},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.885553Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:8d8dba2ac7699d5c03e5d4371b6c77c14bf6964d7a4a39986510998f515bbd9b","observation_id":"4f0b568c-c5c1-44a7-b430-f2f978e0c9a7","resolution":{"observed_at":"2026-08-15T20:16:59.383640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.362154Z","title":"Modeling context in referring ex- pressions","venue":null,"work_id":"84efdb64-08e0-4f4e-b800-d1ba58e8f44c","year":2016},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.891395Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:95c7173776a134439404f04411a66ab43b1b893e72e1885848022c7fbe783b24","observation_id":"eb512e66-fed9-4fae-a4e3-ec12d96fd7a8","resolution":{"observed_at":"2026-08-15T20:16:59.367796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.345052Z","title":"Mattnet: Modular at- tention network for referring expression comprehension","venue":null,"work_id":"e4bed9b1-f4b6-403a-a2a1-d377936c9a1f","year":2018},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.897950Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:98ccadffe7e2fc9c7abd210ffad96b3d2b8de6091a58d410cd1ed1880afae78c","observation_id":"1c129d7c-e875-416b-853c-170fdfce50a0","resolution":{"observed_at":"2026-08-15T20:16:59.349089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-08-21T19:15:22.406940Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-15T20:16:58.901751Z","title":"Internlm- xcomposer: A vision-language large model for advanced text-image comprehension and composition.arXiv preprint arXiv:2309.15112, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.901751Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:f13f96fbb1dac48fdd36a135c0aa22afa8c94bedbd080a55eb3181df175f67e1","observation_id":"b05a6990-4bb2-41d3-8a60-0c3e709790b7","resolution":{"observed_at":"2026-08-15T20:16:58.901751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.329142Z","title":"Psalm: Pixelwise segmentation with large multi-modal model.ECCV, 2024","venue":null,"work_id":"c2451e5f-8e4e-4243-8644-d353b711a710","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.906875Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:f5dd94b6a469b7b74660af1dff367caa59a4015c1c5e3c96a2833d56dc3aa847","observation_id":"7ba8ef71-1fab-4795-afc3-334ac4aee03c","resolution":{"observed_at":"2026-08-15T20:16:59.336296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.310768Z","title":"Semantic under- standing of scenes through the ade20k dataset.International Journal of Computer Vision, 127:302–321, 2019","venue":null,"work_id":"2f76e7f1-02d4-4146-92f4-234ecfc42112","year":2019},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.911111Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:ec40aa63b2fcacd02050aa36890bfcba4d0dfbfd4ddab469c5ee4c048dbb70e4","observation_id":"938ef0b2-7e23-4d15-ad74-a1309214d717","resolution":{"observed_at":"2026-08-15T20:16:59.314946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.291306Z","title":"Seqtr: A simple yet universal network for visual grounding","venue":null,"work_id":"c8193047-cb6a-41b4-80ba-8b744c14e047","year":2022},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.915235Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:e681145f6e60e117b79923de4ba85f363121d6da6f0e25a815e2a0eebb72ae94","observation_id":"66b180ee-7c13-4264-8123-5b927ead9590","resolution":{"observed_at":"2026-08-15T20:16:59.297994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.275629Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"9514cb32-c6c0-4a2e-818d-a2f6f5f4853a","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.920314Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:bdbd0d4b8a86f4f23dff4ade4cc34864019155c00da8d07abe659d65965b710e","observation_id":"2d64df02-9f33-4e03-9224-700845df341e","resolution":{"observed_at":"2026-08-15T20:16:59.280239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.262892Z","title":"Self-supervised multimodal learning: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"18cdf8b8-9086-4096-b2f8-8119d898164b","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.925298Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:09ff757ec1b3c2050b38cdf02a4e300cba4d4a28a8d3bd96f159ead780c4e3ae","observation_id":"a9afa6c4-e6a8-4cd6-8197-f5fbcc5d9e04","resolution":{"observed_at":"2026-08-15T20:16:59.267109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.249956Z","title":"African Bush Elephant","venue":null,"work_id":"f6ddd3bb-77a8-46b4-b111-1e4dbe6bf147","year":2024},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.929785Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:cdcb4937c01742a7096d5b0103ae40deba92b24233e2be945e6d92e09486f175","observation_id":"cc76aa36-84ac-4c55-8617-f4d0e434c4f5","resolution":{"observed_at":"2026-08-15T20:16:59.253827Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.236371Z","title":"Example: ”Corgi,” ”Macbook,” ”SUV”","venue":null,"work_id":"b6cb1fc0-7b18-4647-864a-bce50e9d75a4","year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.934481Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:8a250663533243e55aea1a61a549801acfdbce9b919012b9085a8abc88714cb6","observation_id":"0a367a30-0dd8-450b-9960-592763aefe07","resolution":{"observed_at":"2026-08-15T20:16:59.240731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.215191Z","title":"Example: ”Dog,” ”Computer,” ”Car”","venue":null,"work_id":"fa67c40a-8c26-4be4-be49-c64f82d4ea11","year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.939015Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:0bdad36faa9e4be28faf12992e414dfc577299e58a280a3d3d16f903d20adbf6","observation_id":"f4753a50-ffbd-4c01-ab14-c275b8ae4886","resolution":{"observed_at":"2026-08-15T20:16:59.222331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.194777Z","title":null,"venue":null,"work_id":"df81c4be-ded5-4e3d-aae3-fb1bdf949d92","year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.942505Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:6135867cdd062744aa4c92e165781290f0c4b466e891b60be5ea2bddc044f97d","observation_id":"fb9810c4-6277-45f4-b69a-2ea6d1c1eec5","resolution":{"observed_at":"2026-08-15T20:16:59.200238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.179465Z","title":null,"venue":null,"work_id":"099c672a-736d-45bc-96fe-8cd92a1d7e5d","year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.945943Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:49df745f222ed477ae84f5cec96b02cf262b866b9be55baa75b849d810996b04","observation_id":"16aa896e-2974-4248-845d-4ba7c0797225","resolution":{"observed_at":"2026-08-15T20:16:59.183700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.165603Z","title":null,"venue":null,"work_id":"9956a781-041b-4ad5-b072-35191af68912","year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.949234Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:124ed5789644c331f2a08e2df533166b1d01862fdf00e994ca2d2fae67c58dcd","observation_id":"725cc3dc-de9d-4460-9e94-aae57275f17c","resolution":{"observed_at":"2026-08-15T20:16:59.170441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.151028Z","title":null,"venue":null,"work_id":"cd47112c-30ec-42a3-a8db-c119563ffe24","year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.952886Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:60379b930891f5a835b80b0d47952abf4cb92dcb738285a23c1f7789b17bf3d8","observation_id":"e5066cdb-9dd0-498d-950e-f4f2794c6898","resolution":{"observed_at":"2026-08-15T20:16:59.155350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:59.135637Z","title":"(2) text answer: it should be one or a few coherent sentences connecting the objects in (1) that answer the question","venue":null,"work_id":"a15f4857-dcf6-4249-96d6-12efbcf9f618","year":null},"citing_paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:16:58.956248Z"},"links":{"citing_paper":"/paper/2505.13788"},"observation_digest":"sha256:8d5521bd04b45d24c46e19e564dce1a6e50f348f705d66b3daffc037889d149f","observation_id":"58c074a2-72e6-4b46-9b35-4cceb24ce2c5","resolution":{"observed_at":"2026-08-15T20:16:59.141753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13788","last_updated":"2025-05-20T00:37:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T06:03:55.828566Z","submitted_at":"2025-05-20T00:37:19Z","title":"Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2505.13788."}