{"as_of":"2026-08-21T10:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1f523105b356e30cc43324c07a8da4781cded3c452163340c635acd1f4b0f75","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:22:12.194352Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:44:08.297552Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T20:42:58.205735Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08189","snapshot_observed_at":"2026-08-03T10:44:08.297552Z","title":"Maruf, Ismini Lourentzou, Arka Daw, and Anuj Karpatne","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11632","last_updated":"2026-05-27T09:42:06Z","snapshot_observed_at":"2026-08-15T16:14:20.644799Z","submitted_at":"2026-01-14T07:16:11Z","title":"KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T10:44:08.297552Z"},"links":{"cited_paper":"/paper/2506.08189","citing_paper":"/paper/2601.11632"},"observation_digest":"sha256:ffdee1d44d492df49e76676a7a8ac733a7c0c4252b77520acbc4e6c31072075a","observation_id":"6e2d48bd-84b8-45e0-be97-51eef825d1f8","resolution":{"observed_at":"2026-08-03T10:44:08.297552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"cited_work":{"arxiv_id":"2506.08189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08189","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maruf, Ismini Lourentzou, Arka Daw, and Anuj Karpatne","venue":null,"work_id":"cbddca0d-c267-4ae6-998c-96a9d03de270","year":2025},"citing_paper":{"arxiv_id":"2605.13667","last_updated":"2026-05-13T15:27:41Z","snapshot_observed_at":"2026-08-12T20:52:24.010877Z","submitted_at":"2026-05-13T15:27:41Z","title":"SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T20:39:56.448121Z"},"links":{"cited_paper":"/paper/2506.08189","citing_paper":"/paper/2605.13667"},"observation_digest":"sha256:294d2c45bfbe01d2fa94a5e941f584bd25a3c45a49242aa64713dcbc743f9934","observation_id":"773895a4-abe5-4930-ac1f-05077e3c49f5","resolution":{"observed_at":"2026-05-14T20:42:58.209549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08189","snapshot_observed_at":"2026-08-01T07:04:59.338909Z","title":"arXiv preprint arXiv:2506.08189 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21580","last_updated":"2026-07-23T17:56:30Z","snapshot_observed_at":"2026-08-18T11:58:49.593146Z","submitted_at":"2026-07-23T17:56:30Z","title":"GraphVid: Interactive Graph-Controllable Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T07:04:59.338909Z"},"links":{"cited_paper":"/paper/2506.08189","citing_paper":"/paper/2607.21580"},"observation_digest":"sha256:1ee9594e467049f5105fb7098e630d7a6e4191b3ac193a519d8d2f8913db9d63","observation_id":"2f9aae3f-2b1b-492e-b041-e6c39371b4bf","resolution":{"observed_at":"2026-08-01T07:04:59.338909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08189/citation-record","integrity":"/paper/2506.08189/integrity","json":"/paper/2506.08189/citation-record.json","paper":"/paper/2506.08189"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T05:22:12.087934Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.087934Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:a2ab55d487d3f39cd48b617d8a7cc2c629d2ec5dd4fc8dbb8487f22b83a4ca9a","observation_id":"c0fc7967-51b6-447b-b055-61b378c7e6ae","resolution":{"observed_at":"2026-08-07T05:22:12.087934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04314","last_updated":"2024-06-02T11:32:19Z","snapshot_observed_at":"2026-08-17T15:07:51.691672Z","submitted_at":"2023-12-07T14:11:00Z","title":"GPT4SGG: Synthesizing Scene Graphs from Holistic and Region-specific Narratives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04314","snapshot_observed_at":"2026-08-07T05:22:12.091525Z","title":"Gpt4sgg: Synthesizing scene graphs from holistic and region-specific narratives.arXiv preprint arXiv:2312.04314, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.091525Z"},"links":{"cited_paper":"/paper/2312.04314","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:44009437575b10d5d4874d90bba6642d70dbd28a13f81b0b4ea36bff55d6f98e","observation_id":"f25714bf-0374-43a8-a38c-dad42bafb371","resolution":{"observed_at":"2026-08-07T05:22:12.091525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.617397Z","title":"Expanding scene graph boundaries: fully open-vocabulary scene graph generation via visual-concept alignment and retention","venue":null,"work_id":"1048b2c4-8452-4618-aad0-f2b23bde2239","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.094288Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:6d1819fafdf0e96eeaae354a9254c30c584a495ab45c2491cffda79a7709d30d","observation_id":"58085406-ab58-40f7-89c5-380f19210270","resolution":{"observed_at":"2026-08-07T05:22:12.620025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.609812Z","title":"Reltr: Relation transformer for scene graph generation.IEEE Trans- actions on Pattern Analysis and Machine Intelligence, 45(9): 11169–11183, 2023","venue":null,"work_id":"ddc560f8-817e-47b3-a086-a6c28aa7ee4a","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.096830Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:2a8227152770f53e2d1cbcd9dfd0ba501622e14e456caffeed83514c3ed5ec49","observation_id":"12ae2883-1520-484f-a502-e06b47a57183","resolution":{"observed_at":"2026-08-07T05:22:12.612736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T05:22:12.099201Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multi- modal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.099201Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:753bd62995f8bc50d7e4ce52901740c172cc565d6052289441c27a3d9b466072","observation_id":"347bb022-99ea-4d76-b760-7e683b7f98cd","resolution":{"observed_at":"2026-08-07T05:22:12.099201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.101904Z","title":"Prism-0: A predicate-rich scene graph genera- tion framework for zero-shot open-vocabulary tasks.arXiv preprint arXiv:2504.00844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.101904Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:b4f07614489c264ddfe59b50d336adbce2e09a88af2f18aab93ac93c58334dc5","observation_id":"ab1b86b8-b2a4-407e-8684-09326248bc2c","resolution":{"observed_at":"2026-08-07T05:22:12.101904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-07T05:22:12.104420Z","title":"Simcse: Simple contrastive learning of sentence embeddings.arXiv preprint arXiv:2104.08821, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.104420Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:f2cd7bfa11bbadad2b799f3b86985ca3ae0a2495db143b9c940de1a5e216c06c","observation_id":"7e752d72-4886-4e04-9aa2-c3206c38b5b6","resolution":{"observed_at":"2026-08-07T05:22:12.104420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-07T05:22:12.107012Z","title":"Open- vocabulary object detection via vision and language knowl- edge distillation.arXiv preprint arXiv:2104.13921, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.107012Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:5e20397a4c6cf398e1149a76aa5c7f94f7b552c9d36940b84a101e7747831616","observation_id":"e4064992-17d0-47ec-9142-2b387f3f5749","resolution":{"observed_at":"2026-08-07T05:22:12.107012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.602604Z","title":"To- wards open-vocabulary scene graph generation with prompt- 7 based finetuning","venue":null,"work_id":"17ef5daa-f2ae-413d-97a9-560f7da1a2e7","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.109479Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:f1a8335dc5a9c395940c54a53d8dcdde2824927e69a249dbcde347204194ff5c","observation_id":"5d2effcd-34b2-470b-8d48-da7c88326306","resolution":{"observed_at":"2026-08-07T05:22:12.605387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01072","last_updated":"2020-07-02T13:02:54Z","snapshot_observed_at":"2026-08-12T15:35:49.539626Z","submitted_at":"2020-07-02T13:02:54Z","title":"Scene Graph Reasoning for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01072","snapshot_observed_at":"2026-08-07T05:22:12.111648Z","title":"Scene graph reasoning for visual question answering.arXiv preprint arXiv:2007.01072, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.111648Z"},"links":{"cited_paper":"/paper/2007.01072","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:d87a1c04ce80eb5331f5b3d85b64546610b8b5ba647591b4a873827b7b78a8d5","observation_id":"ebe5fd25-ee12-4f92-81b4-9fd2e32e8673","resolution":{"observed_at":"2026-08-07T05:22:12.111648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.114195Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.114195Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:ab7eec6af6f0f80e8ac030e1169f626d352e2fdd57660bf34b040fa90bd96487","observation_id":"39fd54ed-26af-4a45-a6aa-a5146ce61db2","resolution":{"observed_at":"2026-08-07T05:22:12.114195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.591684Z","title":"Enhancing scene graph generation with hierarchical relationships and commonsense knowledge","venue":null,"work_id":"1c7507c1-b3e3-4ad7-83bf-812a9ebf8a1f","year":2025},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.116526Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:9b7bddf4db56de90e02fb9db62efc8cd0d14396f0e8976d826d8da8f7577a541","observation_id":"b4b5ce4d-ae68-41f6-aab5-5e5c72e934fe","resolution":{"observed_at":"2026-08-07T05:22:12.594374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.583749Z","title":"Image retrieval using scene graphs","venue":null,"work_id":"06cf9e3b-d673-4350-8d2c-ef8722dc190f","year":2015},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.118645Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:37c84761bcf54460a184b43ed21699719b7f7948f627f10f490d8b2622fa70bb","observation_id":"552fd6b8-9ebf-4403-a986-1561a10867d6","resolution":{"observed_at":"2026-08-07T05:22:12.587225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12648","last_updated":"2024-05-21T09:56:48Z","snapshot_observed_at":"2026-08-16T13:51:01.966830Z","submitted_at":"2024-05-21T09:56:48Z","title":"Scene Graph Generation Strategy with Co-occurrence Knowledge and Learnable Term Frequency","version":1},"cited_work":{"arxiv_id":"2405.12648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12648","snapshot_observed_at":"2026-08-07T05:22:12.245417Z","title":"Scene Graph Generation Strategy with Co-occurrence Knowledge and Learnable Term Frequency","venue":"cs.CV","work_id":"bf515c5f-7e06-4845-803a-3939e0ae0f67","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.120736Z"},"links":{"cited_paper":"/paper/2405.12648","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:739fb61ed5ecb635b642933b552a4f1f98b6d4ffe07f3a145180813bde227495","observation_id":"696ec004-e2bf-40ce-9e50-a1f600cdf44b","resolution":{"observed_at":"2026-08-07T05:22:12.250576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.576298Z","title":"Llm4sgg: large language models for weakly supervised scene graph generation","venue":null,"work_id":"ae557736-a9b8-4733-a928-e012890268c1","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.122900Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:738bc23bde35733f86ed039ac66cb282136d377388e01ff0e7cb7383027619f1","observation_id":"e21e7d9e-d8eb-4955-8b94-c9698e1a00c8","resolution":{"observed_at":"2026-08-07T05:22:12.579047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.568762Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":"456e38ad-fc5e-4e53-8983-fc1e7726f137","year":2017},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.125074Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:9e3d3696b97d4fe4ff31a3fd0fb61117ca55b9dca22fbc956635394b9a5bda94","observation_id":"c181adb0-57cc-41bd-bad9-4d7bad47c8ea","resolution":{"observed_at":"2026-08-07T05:22:12.571701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.561008Z","title":null,"venue":null,"work_id":"b4e6a888-70ae-4108-afb7-9323b5dd6957","year":1956},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.126991Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:2f589d89ec7633108b6f1dee84b918d76aa0688c616677159e400f18bd3083ff","observation_id":"96942250-333e-4d51-94be-96c8e55e2d9c","resolution":{"observed_at":"2026-08-07T05:22:12.563917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.553702Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"9351a1d4-8b48-45e4-9762-a2d5f1277ccb","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.129134Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:474d0e8c908a66372b4587c64340411a7bf1612cc2915fd83d8182f1993c4b3f","observation_id":"234f1add-b521-4887-b86a-e8b758effe78","resolution":{"observed_at":"2026-08-07T05:22:12.556567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.546599Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":"07262743-b550-4e38-9b40-4ea9bc9ac223","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.131213Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:eb5cd2faa32c8cf4fc1fbe777f10313351145b418fde1761c13cfca0ac9c0901","observation_id":"7060702d-f3f2-47d5-a9cf-5442e3405a86","resolution":{"observed_at":"2026-08-07T05:22:12.549301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.133250Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.133250Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:d6268d040691ec907e91d058fa5d2c988617dec3490f88474d7fdd1668f7ff97","observation_id":"cc27b857-6ec1-4e1f-82c9-3807eda49d7a","resolution":{"observed_at":"2026-08-07T05:22:12.133250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.534323Z","title":"Sgtr: End-to- end scene graph generation with transformer","venue":null,"work_id":"1a21b56f-9f0b-46b7-8b99-5dfeeb46b4eb","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.135454Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:ab69599414443af54a79fab859a3b8aafa7fb93e62cbd7fe836e9a7c05d31b15","observation_id":"5b0f3a94-2ee0-4e36-8300-118e09f4fc59","resolution":{"observed_at":"2026-08-07T05:22:12.537311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.527503Z","title":"From pixels to graphs: Open-vocabulary scene graph generation with vision-language models","venue":null,"work_id":"c94ce791-7102-4311-81a0-913c6e5f6ed8","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.137587Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:d4f75300714f2f86dfc7f89548485fff393d6f12e7710167c790dd30e89c4896","observation_id":"a643e086-5fad-41cd-8288-23c100320f15","resolution":{"observed_at":"2026-08-07T05:22:12.530043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.520624Z","title":"Gps-net: Graph property sensing network for scene graph generation","venue":null,"work_id":"b2b10b9a-bf6e-42f1-971b-fdfd3d3673ea","year":2020},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.139572Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:fd12dcbe57aca768637ba05947f79b8ac3b117097a98c714c9750a909c42c30c","observation_id":"2d53b965-e8b6-454c-b67f-ab098aab04df","resolution":{"observed_at":"2026-08-07T05:22:12.523285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.141548Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.141548Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:13071c67fe35a90929005a161395a81c6682bc03244af0b5a8b75627089c5e66","observation_id":"e5deb73b-4c2c-4de7-bd78-7351c852f8e3","resolution":{"observed_at":"2026-08-07T05:22:12.141548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.143903Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.143903Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:64a3bae120e8f0112934e816b79b95962d5c49592c5a98fa0b88d4602f4ed5e3","observation_id":"ba7951ae-a5d1-4c26-98c6-f0aad3cb06fa","resolution":{"observed_at":"2026-08-07T05:22:12.143903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.146147Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.146147Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:ad7b0e28a31f93d5dfc082f6c22934ea139ce0cb20eca4e8310f529412d67010","observation_id":"d68dbdc3-7d4b-4cf5-95da-3c6769641e7d","resolution":{"observed_at":"2026-08-07T05:22:12.146147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.502770Z","title":"Relation-aware hierarchical prompt for open-vocabulary scene graph generation","venue":null,"work_id":"c8be715f-b83d-4d17-91b8-d79926c94ca4","year":2025},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.148127Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:52883956f1c1705fba942e28839e15fa05faf38ec5772c7974f672152617a6be","observation_id":"4f4b881e-e4f8-4a2b-9b7c-e647a1c58216","resolution":{"observed_at":"2026-08-07T05:22:12.505101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.496281Z","title":"Visual relationship detection with language priors","venue":null,"work_id":"f059c24c-f612-4364-ba74-747ce52aab8d","year":2016},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.150609Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:c16fe9a25dbd830ed5f2a03fd41208ad8eee7b354c096a6da2866aaedb95966a","observation_id":"6637806e-20e0-4cd8-9a6c-e7ef2fca36c3","resolution":{"observed_at":"2026-08-07T05:22:12.498561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.489839Z","title":"hello gpt-4","venue":null,"work_id":"5fbf05ab-1cd4-4dc8-b445-3bd748be9ed1","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.152786Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:2e32bd973fbf051a4a281eb23cb44f14c07b6115d67f8ad5f22a1bc70a8e3183","observation_id":"988bbf7c-5eca-4d04-8db9-ae985e5cb788","resolution":{"observed_at":"2026-08-07T05:22:12.491902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.154832Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.154832Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:1abee4ed0601b09362ba21dc8a725f53f8421e8c8770ff937577fdb1a52f4cf4","observation_id":"0eb9fa80-0d12-430a-a583-b5d2f23f67e6","resolution":{"observed_at":"2026-08-07T05:22:12.154832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T05:22:12.156964Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks.arXiv preprint arXiv:1908.10084, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.156964Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:ce3292d4190c0a34490e7871e2515e50b07ae020e3259295787499a0cbedf103","observation_id":"99885462-b79e-4011-8808-e3941a838617","resolution":{"observed_at":"2026-08-07T05:22:12.156964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.478849Z","title":"Learning to compose dynamic tree structures for visual contexts","venue":null,"work_id":"bde7524f-908e-43b4-8644-f5d3107818b9","year":2019},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.159122Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:3e829a8b68de7a39e7abd5acb4a827120c786115b1160d823fe720efba0ef706","observation_id":"812dc2d4-3b6a-4774-8498-ebbc3dfc3623","resolution":{"observed_at":"2026-08-07T05:22:12.481150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.471388Z","title":"Unbiased scene graph generation from bi- ased training","venue":null,"work_id":"3008bb62-9105-457d-ad37-99e48a8e7552","year":2020},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.161392Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:85d53981b1beb200ed96c23f288d279aa6f3cfd2aa9f9a3d12497c4ce853d653","observation_id":"503d2f66-2ac8-4fb3-8522-b3c0e83d734c","resolution":{"observed_at":"2026-08-07T05:22:12.473950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:22:12.163539Z","title":"Gemini 1.5: Unlocking mul- 8 timodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.163539Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:d31362ef319d63bfb3867030cb0d8ed4167bf3a1d703cd67f93648ca49e9f9b4","observation_id":"65b3abb5-eb71-4ee9-b3a4-86a26d7bf75b","resolution":{"observed_at":"2026-08-07T05:22:12.163539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.464380Z","title":"Graph-structured representations for visual question answer- ing","venue":null,"work_id":"03301dcc-8ff0-4393-b314-5ba20fa5d5e9","year":2017},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.166021Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:e56d5dad2cd415d8c21189104277fe1571cb1df84258e70a357f3b172fbf774d","observation_id":"dd5f0b44-2676-4109-b62b-4b17ab9b1d5e","resolution":{"observed_at":"2026-08-07T05:22:12.466765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.457629Z","title":"Structured sparse r-cnn for direct scene graph generation","venue":null,"work_id":"ade26a64-337c-4ea8-99c0-bdd7a5e7cb33","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.168519Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:a614179067e625888fa87ec0f023dcb58df760a29ffa4af97c9ceb70d1b70ea0","observation_id":"f63bdcee-c9a4-4717-8cd2-4cd0d6011ecc","resolution":{"observed_at":"2026-08-07T05:22:12.460126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:22:12.170659Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.170659Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:f9668b4cc2f328e3ba7878847df1147cf854836846dbc56f9c2a35a54fa04897","observation_id":"95efe330-ac5c-42a4-88bf-5db75ab49aa4","resolution":{"observed_at":"2026-08-07T05:22:12.170659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.450838Z","title":"Scene graph generation by iterative message passing","venue":null,"work_id":"06d3bd7d-b790-4a4a-82fc-53aca467cce3","year":2017},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.173090Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:89d069fe8fe28f1246c96522781bf4bf830181db7ee5a3e7cd5fe60ca494d504","observation_id":"de25351e-2698-4140-9294-4e3b9e37c319","resolution":{"observed_at":"2026-08-07T05:22:12.453061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.444558Z","title":"Llava-spacesgg: Visual instruct tuning for open-vocabulary scene graph generation with enhanced spatial relations","venue":null,"work_id":"851601ea-1991-4549-9846-2d4665c90b2c","year":2025},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.175109Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:e4f61063ec42a71673d504b0dc286f20e3da4d3c04aa7f2adcb1feac7d8d8864","observation_id":"61c721cb-7ad3-4e2d-a19c-af7d4c3059f5","resolution":{"observed_at":"2026-08-07T05:22:12.446937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.437820Z","title":"Panoptic scene graph gen- eration","venue":null,"work_id":"46dfea8b-32dc-4d7b-b80e-387c29c904ba","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.177220Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:51323f062512d1cf6a255a7221f88c14292fa27abb5f6926e0ac0221c981e715","observation_id":"4c8bca80-1123-4596-8c8e-04df8d28fe3a","resolution":{"observed_at":"2026-08-07T05:22:12.440066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.431660Z","title":"Depth anything v2.Advances in Neural Information Processing Systems, 37: 21875–21911, 2024","venue":null,"work_id":"60a2ff0e-d8a7-46ed-bd55-f6130050e0af","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.179475Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:e7f50e8b5689dc67c5455284fff60ecd20690bb1fb22022ee26b81d3e7e87a0c","observation_id":"9d37b875-eaef-4109-87f9-bdf8b9876244","resolution":{"observed_at":"2026-08-07T05:22:12.433926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.424014Z","title":"Cross-modal rela- tionship inference for grounding referring expressions","venue":null,"work_id":"c64e5409-587f-4eec-87e2-cc55062e502a","year":2019},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.181569Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:750a7e32050d85840fefdb7ccb57b7ffab15fe18a9a0aa9bdfff78fc98867e4f","observation_id":"8fa9a057-99ad-4258-87da-e326a9954e9a","resolution":{"observed_at":"2026-08-07T05:22:12.426876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.416061Z","title":"Visually-prompted language model for fine- grained scene graph generation in an open world","venue":null,"work_id":"a7b2d63b-a891-430d-9072-76dfc2ef238a","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.183631Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:d82e3e52a4154d99e9fdef60f0be309dbc0753c243c967bbf6ca8884d84b5506","observation_id":"ba671b8e-4c7b-42d5-91d1-bb93b9c4bb5c","resolution":{"observed_at":"2026-08-07T05:22:12.418720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.408880Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"7db48e9d-4ab9-400f-adca-c7b2f34b24fe","year":2021},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.185895Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:6fd27693e47bb4cc93fb8337887dc3a0da9497189d38da915ce97b785a0bd3f5","observation_id":"0d6453c6-b1c5-4294-8718-c055ff3cd14a","resolution":{"observed_at":"2026-08-07T05:22:12.411258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06640","last_updated":"2018-03-29T16:17:53Z","snapshot_observed_at":"2026-08-14T20:12:31.767269Z","submitted_at":"2017-11-17T17:33:01Z","title":"Neural Motifs: Scene Graph Parsing with Global Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06640","snapshot_observed_at":"2026-08-07T05:22:12.187935Z","title":"Neural motifs: Scene graph parsing with global context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.187935Z"},"links":{"cited_paper":"/paper/1711.06640","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:c484f08b8bffacc2dcbb0e3e21be29464b80f3622b535f0fa4ed1cd806e9ec4b","observation_id":"db98507f-16df-4147-ae74-ecbab09f577c","resolution":{"observed_at":"2026-08-07T05:22:12.187935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.400720Z","title":"Graphical contrastive losses for scene graph parsing","venue":null,"work_id":"515028a0-f55c-4336-be01-4a854946da38","year":2019},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.190254Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:e1ba828eea524ee38d0a0f7e42280bc0c5c1ba5e1480d508e7d846775014b902","observation_id":"e0d9e044-a009-4de3-a517-797cc1b16b3a","resolution":{"observed_at":"2026-08-07T05:22:12.403580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.393873Z","title":"Learning to generate language- supervised and open-vocabulary scene graph using pre-trained visual-semantic space","venue":null,"work_id":"c0168880-e661-4020-9451-71d567c4ae60","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.192405Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:2f4992eee6e60c08d73962d2bca957195df2d5df17a2dafbc0f9efbf8edd0381","observation_id":"eb752ca1-0f56-4403-8f17-e3ca98a7e91e","resolution":{"observed_at":"2026-08-07T05:22:12.396290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.387028Z","title":"There is aXin the image","venue":null,"work_id":"552ec99a-1893-4203-8b8e-9b30ac87756d","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.194352Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:32469a09b6641b816d97ecb032258661e5a83678cbe98983bb01a5cc3f9b0151","observation_id":"d22aa359-343e-48d7-ad0c-99ab81d9d6c2","resolution":{"observed_at":"2026-08-07T05:22:12.389239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:27:32.679784Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 3 inbound Pith citation observations for arXiv:2506.08189."}