{"as_of":"2026-08-10T07:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:035003a996d6ebd03d79698fc3c3f1377d32e1a67f4db54ccc9eda8636d9c5ff","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:19:40.237501Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19599/citation-record","integrity":"/paper/2507.19599/integrity","json":"/paper/2507.19599/citation-record.json","paper":"/paper/2507.19599"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T14:19:30.864771Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:30.864771Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:46911b1080517fa44d40af54237f6eb145aab89f56dd1481c0d220f90dfbea2d","observation_id":"f4a2b7bb-2e0c-4a06-b9fb-9f8b22e30d21","resolution":{"observed_at":"2026-08-06T14:19:30.864771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:52.227730Z","title":"Burst: A benchmark for unifying ob- ject recognition, segmentation and tracking in video","venue":null,"work_id":"53fa5962-0e15-4868-aa5f-df4c36f7d9ee","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:30.941003Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:2f3e53d8926f04c7cb05b8cf392be07defb33f508e04abdc858c7c4426196008","observation_id":"15a59f5c-3d8f-4f09-ab56-e0507cb122af","resolution":{"observed_at":"2026-08-06T14:19:52.299469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T14:19:31.060322Z","title":"Qwen2.5- vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.060322Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:af7e0a876d3f0edf29097bec9b65e174ca301376c416c3b4cb435aea19d01c8f","observation_id":"72cd616b-060b-4990-93c0-ea6b3f62f79b","resolution":{"observed_at":"2026-08-06T14:19:31.060322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:52.103641Z","title":"One token to seg them all: Lan- guage instructed reasoning segmentation in videos","venue":null,"work_id":"3ed10b48-2c3e-4b02-b2b3-4c61b8350c13","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.203054Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a502040436c744670f11024ae0004f0e6570528dd1d02d18b3a9905d472aba81","observation_id":"64102306-6b7f-4f91-80c3-f32aa1652cfa","resolution":{"observed_at":"2026-08-06T14:19:52.160107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:51.873361Z","title":"Xmem++: Production-level video segmentation from few annotated frames","venue":null,"work_id":"c438af22-1762-4b32-a523-f9a9685b66dc","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.309544Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:b7bd50822d5a47565646d6b22afd582305aedd23454e82b2d6f859c30de13426","observation_id":"de2d2fdc-fc69-4e84-a048-286ac09946bf","resolution":{"observed_at":"2026-08-06T14:19:52.024268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:51.678062Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":"ef3ac369-2f61-48ca-a9da-790faf2165b8","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.414465Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:6e6f33abc9b088a68c382c7703cd845c12820166fb826fa5678d87219c7d5303","observation_id":"3897ae52-368e-4cf8-a23e-9833ac40268c","resolution":{"observed_at":"2026-08-06T14:19:51.766255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:51.425564Z","title":"Vip-llava: Making large multi- modal models understand arbitrary visual prompts","venue":null,"work_id":"465a060d-652e-4bd3-88f3-61697bd7bd95","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.529633Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:5a3b8d1cf224e643f95c6433f84d95b3ccfd5f8e7f34f36738868021dd1a8d8a","observation_id":"6fca08f5-55d2-42a4-8ad2-c38d9365bb64","resolution":{"observed_at":"2026-08-06T14:19:51.512367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T14:19:31.659606Z","title":"Shikra: Unleash- ing multimodal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.659606Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3175ed3e8e9fc6c4f86ab4cc686fe318b518e2e804349d862f811f02613db97d","observation_id":"5d06ad8b-31d9-4502-86fc-bb077eb6f79d","resolution":{"observed_at":"2026-08-06T14:19:31.659606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14469","last_updated":"2024-08-26T17:58:47Z","snapshot_observed_at":"2026-08-03T05:07:34.097529Z","submitted_at":"2024-08-26T17:58:47Z","title":"Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14469","snapshot_observed_at":"2026-08-06T14:19:31.776850Z","title":"Grounded multi-hop videoqa in long-form egocentric videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.776850Z"},"links":{"cited_paper":"/paper/2408.14469","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a1e3ad87ae7ca6818642de93176c3aa02f37561090e239aa5faabc7b62864400","observation_id":"1ee91e18-9a87-407e-9fd5-9213426db69f","resolution":{"observed_at":"2026-08-06T14:19:31.776850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:51.199838Z","title":"Detect what you can: Detecting and representing objects using holistic models and body parts","venue":null,"work_id":"2a96c1be-d64a-4fe0-a54a-bf4ab20be3c0","year":1971},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.883436Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:11f6f6fee0173400774aec7207f540ae84d9897878de0ac399d7331b72c0e3ca","observation_id":"c8d0e2f8-5dd9-4fac-8c69-b65e8e9c55ea","resolution":{"observed_at":"2026-08-06T14:19:51.309218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T14:19:31.985474Z","title":"How far are we to gpt-4v? closing the gap to commercial multi- modal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:31.985474Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:803c5dbf164941dfeb07cf84e562bfbc6a9cf2308a3edb66b452a8025ec3b064","observation_id":"87cfd5da-20c0-4dd2-be86-c82accb6bea4","resolution":{"observed_at":"2026-08-06T14:19:31.985474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:50.977071Z","title":"Xmem: Long-term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":"d1786eba-f622-4d09-8dd7-45315f7c61eb","year":2022},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.101781Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3b5f749b47bf3b16936ca951441b8f71487e395c36bf2c0909b519606a2c09a8","observation_id":"08867776-fa48-4a4a-afc0-7032580eddf9","resolution":{"observed_at":"2026-08-06T14:19:51.085303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T14:19:32.183705Z","title":"Videol- lama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.183705Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:9a2e860a2dc52c1caf88b2ddb55998360504b79462523290a50c4ec9cb35f03f","observation_id":"467cceab-2790-4e27-8aab-b4c40e40fda3","resolution":{"observed_at":"2026-08-06T14:19:32.183705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:50.742457Z","title":"Grounded question- answering in long egocentric videos","venue":null,"work_id":"ee2e7a8a-8a5d-4013-bf1d-24cc550a8098","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.316400Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:4bcf0a62db4acd2369cd6f10c824a712c20a5bc0a5be548bf68f5f0a80140399","observation_id":"6e4f8a82-6789-47d6-ab6f-b8fe37747739","resolution":{"observed_at":"2026-08-06T14:19:50.848944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:50.447312Z","title":"Mevis: A large-scale bench- mark for video segmentation with motion expressions","venue":null,"work_id":"a0164c6f-8ca7-4ab5-8564-869f1d29f949","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.471391Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:0b23255eab11c0af83cb2a41549c0f7b6b39f88bc4eb0ad017435f2d0fc5426f","observation_id":"b9e99d39-f6dc-4276-9c58-823895421b22","resolution":{"observed_at":"2026-08-06T14:19:50.598223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:50.107194Z","title":"Mose: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":"f351435b-5696-41c2-89ea-b01db917e6b8","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.592931Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:7ba00644497ef6b5be6b31b08d8ff880b677aa20753b81f0a10f69a380b29a68","observation_id":"d3ab6386-277c-40ad-a059-8b69694a63cc","resolution":{"observed_at":"2026-08-06T14:19:50.279506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19326","last_updated":"2024-05-01T01:30:58Z","snapshot_observed_at":"2026-07-06T18:07:30.890899Z","submitted_at":"2024-04-30T07:50:29Z","title":"LVOS: A Benchmark for Large-scale Long-term Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19326","snapshot_observed_at":"2026-08-06T14:19:32.702316Z","title":"Lvos: A benchmark for large-scale long-term video object seg- mentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.702316Z"},"links":{"cited_paper":"/paper/2404.19326","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:4f0c91d16d76c54615d4eff44180697e132a3760386d9f5cd64e47b156a28488","observation_id":"a69ad915-4348-4f40-b026-8ab69739055a","resolution":{"observed_at":"2026-08-06T14:19:32.702316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T14:19:32.811828Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.811828Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3ed3653a686f94ecc8b3f8aa8018c9d061102cc39c36af752f6c2fd9435111eb","observation_id":"615ca1a8-b839-481e-86be-2a949d326ed0","resolution":{"observed_at":"2026-08-06T14:19:32.811828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T14:19:32.918892Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:32.918892Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1c53d5a6379bf308580e5b63bfc5cc5bc489724930a398d02d34c623fe2ffb53","observation_id":"2a6d0135-259a-4498-af7e-5c2be488fbd3","resolution":{"observed_at":"2026-08-06T14:19:32.918892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:49.837594Z","title":"Cotracker3: Simpler and better point tracking by pseudo-labelling real videos","venue":null,"work_id":"9a6b9c98-7bd6-479e-8d9d-fc9bf5b5aba7","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.036045Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a23feb849d82b3d5fc87ebb1f49a6a9160ce6e72cb866cceccc63770635f3250","observation_id":"a4d82382-ce65-4f2f-90f6-875055bd318e","resolution":{"observed_at":"2026-08-06T14:19:49.949105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:49.607871Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"cf20afef-f68c-437d-aee2-6eb09522334f","year":2014},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.140267Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:8d7dd284bbe40f8eb1cf23e11c47648491bee4948550d3a0a93040074c3afcc6","observation_id":"8e024cfc-dbb8-4abf-99fb-9249ed304db2","resolution":{"observed_at":"2026-08-06T14:19:49.720019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:49.361370Z","title":"Video object segmentation with language referring ex- pressions","venue":null,"work_id":"29a4c456-86a4-4162-91f3-a1691cd65168","year":2018},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.238590Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:2fa65a307db2bef91920c5c7301ef7e16b264450b69b3532936821ef70bb3237","observation_id":"29c9ab82-2837-4706-add4-46a147faccd3","resolution":{"observed_at":"2026-08-06T14:19:49.479956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:49.087270Z","title":"Segment anything","venue":null,"work_id":"a61186e7-19cd-45ec-bcb7-2724a851d6e7","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.380141Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:0b4b95472a6d112b2aad813186771a59ac0d4dce9c9cc547ffdce75e87af4270","observation_id":"a306dbb0-bdd4-4aa2-8e53-6b96dab7dc20","resolution":{"observed_at":"2026-08-06T14:19:49.210901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:48.812855Z","title":"Grounding language models to images for multi- modal inputs and outputs","venue":null,"work_id":"95929796-da84-4548-beb1-9ed062fd91ab","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.502374Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:2e0c1107d150aa37b7e487937caf7ded07121d82c0f0e1fade85e3acf8e64b95","observation_id":"79e37907-115d-4a89-8f14-eeb865c5259e","resolution":{"observed_at":"2026-08-06T14:19:48.929539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:48.502608Z","title":"Generating images with multimodal language models","venue":null,"work_id":"f653dd61-04a3-4b6d-8c38-2f2ecb3a1ecd","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.605622Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:47d9bea8749e8194ae90edbc35b29ccbcc821f0515cd7b7def5f6d2178ec5fdc","observation_id":"58447ff6-88b7-4e0d-ab6b-135f1d9fc163","resolution":{"observed_at":"2026-08-06T14:19:48.636508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:48.207497Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"a28344fc-663f-4dfa-a0d6-6704aa657abb","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.708532Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:72cf2499ce9fd70149874c192093e32c76aaa2dc5e8e32c48b89e2d92e0c62d2","observation_id":"d3f1ad95-2d6d-41cb-b41c-26b35e07aed9","resolution":{"observed_at":"2026-08-06T14:19:48.380741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-06T14:19:33.841194Z","title":"Mimic-it: Multi-modal in-context instruction tun- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:33.841194Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1517a978bb384bb4a08e0db6ace9c1ae7c1abd9a2f5eac89eb6a52626182cd8d","observation_id":"f50cf220-2210-43f9-852c-2d9ad08ed121","resolution":{"observed_at":"2026-08-06T14:19:33.841194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T14:19:34.009655Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.009655Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:60e71d019f836694955b2a4d0e05f56e83c0f5bfe8ab4ea4a3e2dc2d3e87e04a","observation_id":"95ea52ed-4eec-4bce-990b-893c9990c20e","resolution":{"observed_at":"2026-08-06T14:19:34.009655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T14:19:34.124422Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.124422Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1b690aa675409f5995713ab0ee5d30a8ccb7aef3e6390a6bd42469e2e9f0b5e3","observation_id":"f7cad20f-21af-4df1-92e8-4210147ffecf","resolution":{"observed_at":"2026-08-06T14:19:34.124422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:47.965442Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"647eb501-6f38-4e7c-957d-d0b1f544df51","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.242376Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:e123d985f5770fe08ee295d73bc5347790ae6e110054faea535f53829de5cc90","observation_id":"172277c2-04cd-4578-9645-535d88e70850","resolution":{"observed_at":"2026-08-06T14:19:48.097986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01203","last_updated":"2023-08-18T18:48:33Z","snapshot_observed_at":"2026-07-06T13:27:22.300465Z","submitted_at":"2022-07-04T05:08:09Z","title":"Towards Robust Referring Video Object Segmentation with Cyclic Relational Consensus","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01203","snapshot_observed_at":"2026-08-06T14:19:34.362625Z","title":"Towards robust referring video object segmentation with cyclic relational consensus","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.362625Z"},"links":{"cited_paper":"/paper/2207.01203","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:930835d58839794515468dc0ab28f405d185a527698ef36a4f61344b70283675","observation_id":"3a772343-879c-4ae3-8d14-0f5d729134dc","resolution":{"observed_at":"2026-08-06T14:19:34.362625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:47.734557Z","title":"Describe anything: Detailed localized image and video captioning","venue":null,"work_id":"d318550b-d089-4220-ad6a-b9488da5fee0","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.543370Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:764ee0f3ce150af9bad80764dd1d94e19f56d7ec946d525ed55531fd16e86792","observation_id":"0b453265-6047-4a43-867c-f4127e8ee3d2","resolution":{"observed_at":"2026-08-06T14:19:47.846987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T14:19:34.701074Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.701074Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3f959a6a02e7076fe410c3dcc823f17fc88524a104b24181337267668fdfa2de","observation_id":"b81e087f-251f-40a7-ae09-ceb99b331e7a","resolution":{"observed_at":"2026-08-06T14:19:34.701074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:47.425295Z","title":"Rouge: A package for automatic eval- uation of summaries","venue":null,"work_id":"42d2839a-8519-4e34-aa4a-258c9c5b1295","year":2004},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.792454Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:16b252d845ad05892caabb61057d18549f1e653b9f16964e9b3b5028118a1dd2","observation_id":"1237dd00-ff9e-45c2-adab-a977ca078d9e","resolution":{"observed_at":"2026-08-06T14:19:47.568836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:47.158110Z","title":"Glus: Global-local reasoning unified into a single large language model for video segmentation","venue":null,"work_id":"bde690b7-9cb6-4aba-9d05-5980130ebb89","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.885264Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:4356d225f7ccd8f58fa628033e6902086f7351ce8471b3cf1161a081c517afdf","observation_id":"a155d143-04a0-4678-ac25-5bd7cbdcefed","resolution":{"observed_at":"2026-08-06T14:19:47.292410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:46.908053Z","title":"Visual instruction tuning","venue":null,"work_id":"8f9f4745-a979-4167-baa0-173bbf1046b1","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.986936Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:edf3aa735b6393ae098456c5b372e1fdbf5b8e96479d777f17a2ea281b209b50","observation_id":"a14696b6-30a5-4cce-8ba6-08e350b0cc02","resolution":{"observed_at":"2026-08-06T14:19:47.019287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:46.620551Z","title":"Lamra: Large multimodal model as your ad- vanced retrieval assistant","venue":null,"work_id":"77093ec2-136d-4863-8ffe-63c7c90fc72b","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.099805Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:f92320eab7e892f8121a50846c3dbe4ec6b5f05706192ec17d996215a98e41c0","observation_id":"47c75236-174c-43bb-82be-0cc419d7d744","resolution":{"observed_at":"2026-08-06T14:19:46.770684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T14:19:35.242260Z","title":"Decou- pled weight decay eegularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.242260Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a2b2864dcebd263f5376ec698d52a25baf12f9e4de0dde0566efcc8dfbab4a4e","observation_id":"2dc44f75-013a-403d-be4b-9560b923ed50","resolution":{"observed_at":"2026-08-06T14:19:35.242260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T14:19:35.344758Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.344758Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:c008d655fad5b9b50c1eb4d0de8f2758a2c8d37166587c9946b6c5abc96fe4ea","observation_id":"aa765c0b-ad33-427e-93f2-d3503289bb97","resolution":{"observed_at":"2026-08-06T14:19:35.344758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:46.403058Z","title":"Generation and comprehension of unambiguous ob- ject descriptions","venue":null,"work_id":"9dac99c5-4f55-445b-825b-0e855828a8d1","year":2016},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.462523Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:d17adbb59de70cc2012843873400c45fa1cf56ba55216cffb236463326e024b8","observation_id":"6cbe70e5-59c8-4e31-98c6-eee78a3e78ec","resolution":{"observed_at":"2026-08-06T14:19:46.495180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:46.198740Z","title":"Large-scale video panoptic segmentation in the wild: A benchmark","venue":null,"work_id":"abe856e6-c25b-44f8-8e28-1f879b7d0a25","year":2022},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.567110Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:971a6caf2edd1c202fca18170e0d80b14e096213b2b5942ea4580d349e5aef40","observation_id":"1ea753bb-c75a-4a3c-af41-dcc1cd2756be","resolution":{"observed_at":"2026-08-06T14:19:46.303905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:45.929154Z","title":"V-net: Fully convolutional neural networks for volumetric medical image segmentation","venue":null,"work_id":"c39c7a33-531f-4d87-afc6-ce35e99736c7","year":2016},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.730518Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:97dd883f57969b189e33b0846c5c6b0570940cda6c713d183a8168bf56e1f528","observation_id":"18aacfb3-e0e4-4215-bf55-5ba9bff3d63f","resolution":{"observed_at":"2026-08-06T14:19:46.043914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:45.722847Z","title":"Bleu: A method for automatic eval- uation of machine translation","venue":null,"work_id":"f0dd0919-9390-44da-96be-52be5167f798","year":2002},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.851977Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:905f8d0e934f80e45bf491ae69d1dfd685f16695be60eb45677f3db2c7ee0f30","observation_id":"0ed6dda5-284f-482d-af20-571d707c01f7","resolution":{"observed_at":"2026-08-06T14:19:45.806001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:45.458530Z","title":"Perception test: A diagnostic bench- mark for multimodal video models","venue":null,"work_id":"aa6de19f-1a9e-44bc-96c1-b5d545bc422f","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:35.974409Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3b93953fa5de56186bbf6f0513139641a9b19932add50c495f5a93f60aac2c20","observation_id":"4fc8125a-1305-44cd-931f-26d4ddd572c4","resolution":{"observed_at":"2026-08-06T14:19:45.588351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T14:19:36.065603Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.065603Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ef36f01a7c67f3a53b9ba5aad3f89bf9a719ee4c380633fe745ef51a1398c1a0","observation_id":"07e3f2f3-ce0a-4fc7-b345-467de8bfbfab","resolution":{"observed_at":"2026-08-06T14:19:36.065603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:45.220066Z","title":"Occluded video in- stance segmentation: A benchmark","venue":null,"work_id":"2106fb22-8b65-4b08-8353-bac32b51eb5b","year":2022},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.172270Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:6bc99cbb5e58f5294caef0e4e4b3897269fa4c58938857ce73ef5d5100116474","observation_id":"fa54ea9a-a496-4f7e-aace-b97d167440a3","resolution":{"observed_at":"2026-08-06T14:19:45.342672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:44.966203Z","title":"Artemis: Towards referential un- derstanding in complex videos","venue":null,"work_id":"8c02356e-d5cf-464d-a0e5-251e1433c455","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.327772Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:774b0e72df0fbf944155030f5d3cfa71af33436ce215982b69504123e7085214","observation_id":"c5968d3d-6c7a-4dee-8860-bda3c817aa7e","resolution":{"observed_at":"2026-08-06T14:19:45.082859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:44.699166Z","title":"Paco: Parts and attributes of common objects","venue":null,"work_id":"3382d291-4adc-47f9-8fac-3b82234944b5","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.435318Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:61d473a9495fec3c11f45f7a0edc955f5123be6293bd06d5c31790b988ea35be","observation_id":"fc7d881a-c0f5-4e22-b453-0570dc9067a9","resolution":{"observed_at":"2026-08-06T14:19:44.828041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T14:19:36.552673Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.552673Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:24a17597c933145b3dea31efb48dc06c4a831d06a6866754dd1d7393dcc5be4d","observation_id":"ca092a3f-da64-4fc2-aee2-c549055601d9","resolution":{"observed_at":"2026-08-06T14:19:36.552673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:44.468337Z","title":"Hiera: A hierarchical vision transformer without the bells-and-whistles","venue":null,"work_id":"734f17e7-15e6-4e12-a633-a178ba883a90","year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.644218Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3dd39e52c6f6021bcd309463feabced60f356eac6876fc197cc7a6e3b67c06bc","observation_id":"5c03be5e-3b00-4980-88c4-78066345f1ff","resolution":{"observed_at":"2026-08-06T14:19:44.575409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:44.243460Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"3fd77734-236d-487c-8ec8-dbf9904e6995","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.749964Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:d69fc0eddc402959e0334dc3a9b5071ff1d37ae3c532fe3fde8bb1aea8afb08b","observation_id":"297c4461-aa4a-413f-8cf5-41104126d5c6","resolution":{"observed_at":"2026-08-06T14:19:44.344740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-08-06T07:46:37.713769Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-08-06T14:19:36.979072Z","title":"Gen- erative pretraining in multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.979072Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:143c0d0c2a9fa5e602fdbc45721b674023a1270818e4605f94729caf21d288d6","observation_id":"624e5f94-9f0c-470f-acef-f2167f960c44","resolution":{"observed_at":"2026-08-06T14:19:36.979072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.775241Z","title":"Cider: Consensus-based image descrip- tion evaluation","venue":null,"work_id":"c5f9ea95-134e-4fba-a6bc-ebf44bc4e952","year":2015},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.123600Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:2d8af8429007c573fda5947d5c3b95ce2d44305505f710e7e3d7024531af1fa5","observation_id":"1b464f74-7deb-44c6-8ad2-d543e84718e8","resolution":{"observed_at":"2026-08-06T14:19:43.856383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.494834Z","title":"Ov-vis: Open-vocabulary video instance segmentation","venue":null,"work_id":"72897b23-c161-45d1-9d41-087c66dfe681","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.236690Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:8800b0cc917ea28dc0842789c759278eb08608a9a60b8296c83e46ba0758f311","observation_id":"bc9be667-cf9b-423a-94e6-5f3465b07219","resolution":{"observed_at":"2026-08-06T14:19:43.599672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T14:19:37.356424Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.356424Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:a98ccf045f295f96baaa1625331739daf4316d9ea2606005f2cae0207a4c23b4","observation_id":"a4c34e4a-92bc-43f1-8a2c-09516a9bef1c","resolution":{"observed_at":"2026-08-06T14:19:37.356424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.244037Z","title":"Unidentified video objects: A benchmark for dense, open-world segmentation","venue":null,"work_id":"97160fc5-89f8-496e-b764-c3f03511a3e0","year":2021},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.497702Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:f903474bfcc4a74c6418231b03730453288bc34e25a52a7a6e3fa4bc376f1728","observation_id":"ff284c6b-ee5d-44f0-b956-a21b58c65482","resolution":{"observed_at":"2026-08-06T14:19:43.351712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T14:19:37.661534Z","title":"Internvideo: General video foundation models via generative and discrim- inative learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.661534Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1a26e861ea6d0d622a12a03a47859503b1309c5ea93a827a2ddeff6f2487a892","observation_id":"6a9aaa68-a589-4f06-9676-baa83d4ef10e","resolution":{"observed_at":"2026-08-06T14:19:37.661534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.015353Z","title":"Internvideo2: Scaling foun- dation models for multimodal video understanding","venue":null,"work_id":"85caa222-527b-4117-838c-f8e96c880524","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.795167Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:5c84bbd30fdcf389545a250d0326058f3a729eebeab5543e89d749103c3c5a88","observation_id":"177d8f52-5c82-4d46-86ca-5d8315692384","resolution":{"observed_at":"2026-08-06T14:19:43.127670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:42.826830Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"b08133b6-9450-4a2e-9678-d06760b02f66","year":2021},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.926811Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1b74c99d6689ebe777cede7322f10b0d28da8c47c27d2899ca7eb7113d092273","observation_id":"ff67cfcd-c3e3-4eb0-bb9c-114846a0b438","resolution":{"observed_at":"2026-08-06T14:19:42.919131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:42.605795Z","title":"Visa: Reasoning video object segmen- tation via large language models","venue":null,"work_id":"b79aa36d-eefd-4d33-9159-c5ef75c2ca86","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.024130Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:d56ed89937e65d7ab287b01d39ff5165a7b5d27d2d3b3c1f8a837c6b67028569","observation_id":"872524ac-7cfc-420a-a0ea-c0d3541c37e5","resolution":{"observed_at":"2026-08-06T14:19:42.729703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-06T14:19:38.109831Z","title":"Videogpt: Video generation using vq-vae and transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.109831Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ef250ef1efb54bcca6a96d5cbe7ef61c7d4b964b63c6ab253dd6333db4f0df47","observation_id":"455e99f2-4c90-42d3-be2f-6e87c41904f0","resolution":{"observed_at":"2026-08-06T14:19:38.109831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T14:19:38.229151Z","title":"Set-of-mark prompt- ing unleashes extraordinary visual grounding in gpt- 4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.229151Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:935b90dbe8f48742f604881f6bd90141226b51b17b4a3e5324d2354c5666917b","observation_id":"44a2257f-8dea-4cd1-8131-6d0e80f5ee68","resolution":{"observed_at":"2026-08-06T14:19:38.229151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-07-31T19:08:37.289553Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-06T14:19:38.352762Z","title":"Lisa++: An im- proved baseline for reasoning segmentation with large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.352762Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:bb341526b8838f41af6d44c29b00c6acd82c33c7f53a3573f0fb3065a59d7bbc","observation_id":"827c5a9c-da2c-4dd7-80b6-f910464b5d2e","resolution":{"observed_at":"2026-08-06T14:19:38.352762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T14:19:38.498533Z","title":"mplug-owl: Modular- ization empowers large language models with multi- modality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.498533Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:b81563a96b4b7e60679f024878a3f4310cca6bf825c115dcb21f7d8816ac3245","observation_id":"cb2f858e-5f53-4f4b-b6dc-fac94a69787c","resolution":{"observed_at":"2026-08-06T14:19:38.498533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T14:19:38.603030Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.603030Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:09d287e5c0dcb169855234e70a4225dc216093548a8c9651b3d312e353557063","observation_id":"dd125f56-671f-4185-abee-9e1900f90ef0","resolution":{"observed_at":"2026-08-06T14:19:38.603030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:38.745855Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.745855Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ee7d03ed08f2acae597d0df4f474f05e4c2c3811578c8f2a6f73f1f296bba0a4","observation_id":"450421f4-78e9-495d-b65b-092441bda764","resolution":{"observed_at":"2026-08-06T14:19:38.745855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:42.377991Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of im- ages and videos","venue":null,"work_id":"5d0f235f-2a46-45e5-b407-234be0f71993","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.813448Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:f146e26b307a0c5fcf13bbb52c59ba2c95aff1dffdaaec5421e29cc64ca23639","observation_id":"972d9ea1-6637-4f61-8713-1686d8528fd1","resolution":{"observed_at":"2026-08-06T14:19:42.467851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:42.166330Z","title":"Os- prey: Pixel understanding with visual instruction tun- ing","venue":null,"work_id":"b335571d-09f7-4d51-8a10-2e12b54d19e9","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:38.918347Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:111e676d6a6798bb5a4b22c1051980017a0daa0b3cdb8c7dd5a84306e55db3cc","observation_id":"a545401d-1949-49a9-8bc6-1d7869e20b88","resolution":{"observed_at":"2026-08-06T14:19:42.256487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:41.876494Z","title":"Videorefer suite: Advancing spatial-temporal object understanding with video llm","venue":null,"work_id":"7ac50c5c-1516-463b-b72e-f9fd8084d459","year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.024526Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:2db052d1f92af820e967cb4ab7caa3ba12eb5ad7a99cd8f2d7d047c80a4b2d4a","observation_id":"ccf18085-1bfe-4023-b3b1-542b44531262","resolution":{"observed_at":"2026-08-06T14:19:42.021520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T14:19:39.140269Z","title":"Vide- ollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.140269Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:8e59077a3c255f9e829b07f46a1f7ef800372a8b0afffcf2261f2b0f9a9db56f","observation_id":"025328a4-de54-48dd-bb8d-b7f8679de765","resolution":{"observed_at":"2026-08-06T14:19:39.140269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T14:19:39.258349Z","title":"Video- llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.258349Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:421136ba366b1bf69330670b94c77007a41a577369ebfe21d335df9c902e223f","observation_id":"b7f6f91c-70a2-46e0-adda-b72c587b9531","resolution":{"observed_at":"2026-08-06T14:19:39.258349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T14:19:39.360265Z","title":"Lmms-eval: Reality check on the evalua- tion of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.360265Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:55db6fcd0dc04c77c01add3bb6a32c7d02a23416bef6490ff48e9e660a5993fa","observation_id":"99f4e4f6-d6ea-447e-b0c2-7f198124978f","resolution":{"observed_at":"2026-08-06T14:19:39.360265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-07T18:00:59.339869Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-06T14:19:39.474732Z","title":"Gpt4roi: Instruction tuning large lan- guage model on region-of-interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.474732Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:f2424774d6bc5a7db39d76be03180c0d248e4e095805f29941ee9e6c0441a29a","observation_id":"b5ee245e-d564-4974-a412-7de86e962e88","resolution":{"observed_at":"2026-08-06T14:19:39.474732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T14:19:39.606964Z","title":"Video in- struction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.606964Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:d158ca01fe4b213ab3b585943cd8dc544f0887f56728e79a7fed26577bbfe241","observation_id":"67cb2719-8b81-48f7-adeb-ca73373abd9c","resolution":{"observed_at":"2026-08-06T14:19:39.606964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:41.663233Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"5b1e3509-7904-4d82-835c-a1e099d5ee0b","year":2017},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.713362Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:ca9a3651405b1a9d07976aa2feb93476986d7cd9e3f8bb94c2def947532565ca","observation_id":"0d770155-febd-4a35-a8c6-8d9ae90f717e","resolution":{"observed_at":"2026-08-06T14:19:41.775584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T14:19:39.834178Z","title":"Minigpt-4: Enhancing vision- language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.834178Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:7d9a15a029e5b446674588c6f91315caae313d842024c828920c21d15da5be47","observation_id":"f836cefc-0b8a-427a-9a92-f9483ff2bffc","resolution":{"observed_at":"2026-08-06T14:19:39.834178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:41.376205Z","title":"The complete list of used datasets in training is presented in Tab","venue":null,"work_id":"336ad50f-20b2-4d31-a702-5b2a8be9c7c4","year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.976573Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:464ef5c569093518e2619593155feedcebfed51cd978d5f136322e33fd8eb5d5","observation_id":"b64863f9-c6e2-441b-8d25-9f17e8265ac1","resolution":{"observed_at":"2026-08-06T14:19:41.512014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:41.119133Z","title":null,"venue":null,"work_id":"eaf8e5df-4925-45e5-a781-49c0b38e4e63","year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:40.126377Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:3d2966693efe40de4631420c263540bea04a7a708ae4584be5e9e988d8aee678","observation_id":"129b29ba-459e-434b-8336-2757de218c6a","resolution":{"observed_at":"2026-08-06T14:19:41.268991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:40.851904Z","title":null,"venue":null,"work_id":"bf768624-6211-449c-9af3-e8b55a54b314","year":2000},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:40.237501Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:5f1ff64d696c5b8dba1fedcc757a0c256b5cf874c00b61fbfd409877916a3a9c","observation_id":"b5b5aa3e-f768-44d4-b4c0-9b6077d8db28","resolution":{"observed_at":"2026-08-06T14:19:40.965085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:19:43.965768Z","title":null,"venue":null,"work_id":"5c64d899-2ef3-4d84-b2db-a7c4b6ac3b08","year":2020},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":223,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:36.874703Z"},"links":{"citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:aeca30919b827a8652735e30ee15eca315dbc46866a88f92f834dae69613ab8b","observation_id":"c21f2be1-ac58-4b45-9031-bf31ee57b6f1","resolution":{"observed_at":"2026-08-06T14:19:44.107775Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":35,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2507.19599."}