{"as_of":"2026-08-15T19:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d31d800823970564cc4ba1d104ab437cc8d6b0787e67b71e9ffc7995fa53808d","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:46:34.180369Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:52.859271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:14.988080Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-07T12:32:52.859271Z","title":"Llava-mr: Large language-and- vision assistant for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-15T04:37:24.290803Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:52.859271Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:16d7a6b7ae2cf409aff0921f6862e60778793e655f6c27533f71a7d8e5583828","observation_id":"a8c5eb12-65ec-487d-8628-b0f2bed9b148","resolution":{"observed_at":"2026-08-07T12:32:52.859271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-06T18:40:02.771931Z","title":"Llava-mr: Large language-and- vision assistant for video moment retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-15T08:49:35.647249Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:02.771931Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:121a18032b847b888222e5baa5818be4375cd77141ef7e17776c638924699cf0","observation_id":"34b3b1a3-7981-425a-a102-7663f633fb81","resolution":{"observed_at":"2026-08-06T18:40:02.771931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-05T23:32:17.938393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-15T18:49:45.191733Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.938393Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:e5461624c908fc74ceb4061320cc37d499c4b38d2e77846011ba334c4a27f253","observation_id":"e4436d2b-52f0-4d91-9374-14e51158659b","resolution":{"observed_at":"2026-08-05T23:32:17.938393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-08-03T21:42:45.907432Z","title":"LLaV A- MR: Large language-and-vision assistant for video moment retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.14143","last_updated":"2026-06-08T00:19:12Z","snapshot_observed_at":"2026-08-13T10:10:53.477612Z","submitted_at":"2025-11-18T05:03:17Z","title":"SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T21:42:45.907432Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2511.14143"},"observation_digest":"sha256:5fd9227ac9a14a965fe9e22ac7e714d98b58ae7faf88678b1022f8029f77bc84","observation_id":"66daadb5-120d-4ba9-985d-3d3e1ae18f45","resolution":{"observed_at":"2026-08-03T21:42:45.907432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":"2411.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-07-02T17:27:14.988080Z","title":"Llava-mr: Large language-and-vision assistant for video moment retrieval,","venue":null,"work_id":"0e50912d-ef0a-40b0-bffc-61df72e7c85f","year":2024},"citing_paper":{"arxiv_id":"2604.09037","last_updated":"2026-04-10T06:58:29Z","snapshot_observed_at":"2026-08-13T15:29:00.642103Z","submitted_at":"2026-04-10T06:58:29Z","title":"SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T17:37:40.373211Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2604.09037"},"observation_digest":"sha256:55f0648fe79d7a94c52c47a5551fd1b8fb2985e25a63ec32d176d42239581b8b","observation_id":"4b3d4251-7538-4694-85e7-b6fa0d1c2d9c","resolution":{"observed_at":"2026-05-11T06:30:58.574381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":"2411.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-07-02T17:27:14.988080Z","title":"Llava-mr: Large language-and-vision assistant for video moment retrieval,","venue":null,"work_id":"0e50912d-ef0a-40b0-bffc-61df72e7c85f","year":2024},"citing_paper":{"arxiv_id":"2606.06294","last_updated":"2026-06-21T07:27:04Z","snapshot_observed_at":"2026-08-13T09:35:12.990364Z","submitted_at":"2026-06-04T15:31:22Z","title":"Towards One-to-Many Temporal Grounding","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T02:11:48.455492Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2606.06294"},"observation_digest":"sha256:c54fc6d25c46bda85ec1d265f5d4e21b87f29dd83f5c3fb1c5fd7fb78a4014e9","observation_id":"905d3179-9bae-429f-9fb5-bafc0ad4fb4e","resolution":{"observed_at":"2026-07-02T12:16:57.671960Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"cited_work":{"arxiv_id":"2411.14505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14505","snapshot_observed_at":"2026-07-02T17:27:14.988080Z","title":"Llava-mr: Large language-and-vision assistant for video moment retrieval,","venue":null,"work_id":"0e50912d-ef0a-40b0-bffc-61df72e7c85f","year":2024},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2411.14505","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:1e4b0fec965e81e8bc535b81dac81cfea09f50fdb116e215fad379c95eb74a03","observation_id":"0b2b1842-8324-47dd-9e39-7e9d9215ef89","resolution":{"observed_at":"2026-07-02T17:27:14.990641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14505/citation-record","integrity":"/paper/2411.14505/integrity","json":"/paper/2411.14505/citation-record.json","paper":"/paper/2411.14505"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:33.987486Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:33.987486Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:94dafabfb8d29b37edd4b71351d2f864a17599eb9d8ebe4043ef00f30e782900","observation_id":"29aea9b4-9f57-4e3d-9a78-1ba0dd04daee","resolution":{"observed_at":"2026-08-12T15:46:33.987486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.822581Z","title":"Localizing mo- ments in video with natural language","venue":null,"work_id":"fb3302cb-37e0-461d-951c-1ea469d59eb9","year":2017},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:33.992151Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:06086dfa0b469f2a46e5c2a013727754a14591f0cf726581f5763db28e804a9c","observation_id":"5e137d13-e512-4518-8e9e-ad2bc1e43c5e","resolution":{"observed_at":"2026-08-12T15:46:34.826376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.811100Z","title":"Openflamingo: An open-source frame- work for training large autoregressive vision-language mod- els, 2023","venue":null,"work_id":"16418478-abda-497f-ad3f-c41a5b20f55b","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:33.995449Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:2324f1dcfbe35779bd4720c719f9fb729684df36fad3e5bfd37b17400fc33f67","observation_id":"74001564-cdce-4479-9e12-72b00375fe3b","resolution":{"observed_at":"2026-08-12T15:46:34.815024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13473","last_updated":"2022-07-11T12:55:51Z","snapshot_observed_at":"2026-08-14T07:55:47.033352Z","submitted_at":"2021-10-26T08:15:47Z","title":"CTRN: Class-Temporal Relational Network for Action Detection","version":2},"cited_work":{"arxiv_id":"2110.13473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.13473","snapshot_observed_at":"2026-08-12T15:46:34.288140Z","title":"CTRN: Class-Temporal Relational Network for Action Detection","venue":"cs.CV","work_id":"bb596143-39be-445d-b2c6-15ff306754f0","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:33.999034Z"},"links":{"cited_paper":"/paper/2110.13473","citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:86ae2dacc8bc2acfcc49e944fde414bf90f741246cb7eb3deb24fa57b2c9b8ac","observation_id":"df9a1c82-2d1e-4c25-bfc5-f7fdc5c9745f","resolution":{"observed_at":"2026-08-12T15:46:34.294023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.799243Z","title":"Ms-tct: Multi-scale temporal con- vtransformer for action detection","venue":null,"work_id":"38730941-d4f5-4c51-845a-4d674c5289bd","year":2022},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.003000Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a8692f55d312c4e58a3c20f2b97c2b8faba7cd18fb4e6402683c72a51a7c16df","observation_id":"49dd12b1-cddf-4b10-8a3f-e4b8a4f74c17","resolution":{"observed_at":"2026-08-12T15:46:34.803597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.006592Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.006592Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:1299f764c628f2b4ba2a3341bd37beeda4b43c9b570f284c16ad388f3a8f222d","observation_id":"52de721a-5de5-496d-8f39-41286100187e","resolution":{"observed_at":"2026-08-12T15:46:34.006592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.780208Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"1639ebc5-c23f-4a34-8010-8c167d5f1ae7","year":2017},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.010324Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:9f3133d194935e0427d4dcd43c7b59ef97985a6f8eb306e134d20a1afff44b37","observation_id":"30268258-4e5a-45fa-8a3a-6bb5ef239cde","resolution":{"observed_at":"2026-08-12T15:46:34.784282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.768714Z","title":"Video action transformer network","venue":null,"work_id":"240a3f4f-b0c9-4e4e-8784-d8d35b2ed1c7","year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.014040Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:bbc9ba9d3fdda5770237ede837c1eba1d1c1ae07d1fdd055f543f5136fd0765e","observation_id":"0b4df684-294d-4393-afa5-0363afeb3d15","resolution":{"observed_at":"2026-08-12T15:46:34.772785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T15:46:34.017653Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.017653Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:cf0f1a59ed48a0c9923501fde5b39075e4b47ee190cc2e0dc89730154d90d77a","observation_id":"9aedc72a-7358-42f7-bd3f-c848bd9d4586","resolution":{"observed_at":"2026-08-12T15:46:34.017653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.757889Z","title":"Knowing where to focus: Event-aware transformer for video grounding, 2023","venue":null,"work_id":"90ad776a-7e42-4cc7-a3aa-d51d9fc15a0d","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.021559Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:1215b7fb5bd052e25fefbf6ad4e75d21a8d0099ccf697bfc78ea5444e9426fcd","observation_id":"557fffbd-95b8-4070-9a83-357119e67536","resolution":{"observed_at":"2026-08-12T15:46:34.761744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.025371Z","title":"Efficient multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.025371Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:7a5950542b202f434fb0a4f9047940f63c99eab47487fda8a75c238a4016c251","observation_id":"3488fcf5-b860-4968-b767-a0b37bab20db","resolution":{"observed_at":"2026-08-12T15:46:34.025371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.029064Z","title":"Dense-captioning events in videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.029064Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:6a1fc2d4bb67f4485aadb100d4466cf62d30862b6b214345e31057aa66866512","observation_id":"2adcebb4-0b78-45eb-a74f-b2fb462a1e8c","resolution":{"observed_at":"2026-08-12T15:46:34.029064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.740200Z","title":"Temporal convolutional networks for ac- tion segmentation and detection","venue":null,"work_id":"f117785b-cec1-40b1-b444-7ba8df0fe0ce","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.032763Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:87a5050f2daa92ec5cee4c3b09a7939b72e6c5626cb0bc53de8606ae49fc74d9","observation_id":"40028e2e-2684-48b2-aea1-10f5e0b6ea3d","resolution":{"observed_at":"2026-08-12T15:46:34.743835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.728577Z","title":"Berg, and Mohit Bansal","venue":null,"work_id":"7f13b2a3-c104-424e-8c47-e8a1ad3d51b5","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.036780Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a6d6e55e1d06c29678d47d527e300fc8f58babad1837321e96f162fe4f7cf866","observation_id":"1351cd3b-6637-480e-94f8-918d8740b673","resolution":{"observed_at":"2026-08-12T15:46:34.732984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.717040Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"c8a8e75c-6943-4812-9429-090735bfc3d8","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.040363Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:bb26c9e481b3a33757243c8630422370c8959e545f12880a889a2af7d6800059","observation_id":"caaaa026-fd5e-4e66-b865-ec6984da59e1","resolution":{"observed_at":"2026-08-12T15:46:34.721157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.043808Z","title":"Mimic-it: Multi-modal in-context instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.043808Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a3d4f6b74bff6ede7b65e89c712ea333ce84e5bd5432421137cf8ff687f27a31","observation_id":"7d3f1942-2f5b-44ea-a7a4-3c544590db18","resolution":{"observed_at":"2026-08-12T15:46:34.043808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.047579Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.047579Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:72723e06b2e7e68f67f5798574dc7297740db65416dbb5b4a2d8e56174a471a6","observation_id":"4fb2af8c-fcc8-4136-9ccf-17de71e758c7","resolution":{"observed_at":"2026-08-12T15:46:34.047579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.690757Z","title":"A survey on benchmarks of multimodal large language models,","venue":null,"work_id":"7d0903be-dc43-4c97-adc1-e665f51487cf","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.051139Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:e690c11d55821c12aee83bf5503df003753be610896e644117015e059c14065e","observation_id":"48d2f88f-bc4d-4379-bd57-59a0eb3a210b","resolution":{"observed_at":"2026-08-12T15:46:34.695108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.054794Z","title":"Videochat: Chat-centric video understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.054794Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:feb0e7e56954a5c8647b35a07acb005a2b0e43e70dfcea563840eed91106454e","observation_id":"7bc2fa66-4b8e-400c-b54a-8c4a5a35b30a","resolution":{"observed_at":"2026-08-12T15:46:34.054794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.672107Z","title":"Fast learning of temporal action proposal via dense boundary generator","venue":null,"work_id":"6efd8d89-aab4-476a-8708-d256fd83ad0b","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.058301Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:1a662e457d44c172bf2d9b4d2c388f209c74b81717db898ee372e88e92d7fb09","observation_id":"5d95690e-881a-43eb-8591-e22017a0498d","resolution":{"observed_at":"2026-08-12T15:46:34.676050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.661083Z","title":"Univtg: Towards unified video- language temporal grounding, 2023","venue":null,"work_id":"f7a38b10-ab5e-45b0-9d84-95b935d32d24","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.061972Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:b2a354685f5e90dec0c13707e7f83dadf771c73f24e7f84916bbf0d22c2790c2","observation_id":"9c8b8761-daf7-43ea-880d-fa85cf37a993","resolution":{"observed_at":"2026-08-12T15:46:34.664660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.650577Z","title":"Bsn: Boundary sensitive network for temporal action proposal generation","venue":null,"work_id":"37e8b796-d03a-4418-a976-03056cd79521","year":2018},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.066083Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:071ba403584ac45d752ec8cae2f8a591f2755d0197323e6ba466d1fa8b19ec7e","observation_id":"71aee2b2-1ce9-4d9b-901d-e25aa33cfbf3","resolution":{"observed_at":"2026-08-12T15:46:34.654031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.069591Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.069591Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:805be8bea845ac011339d0faf182129243efca6c059611f1ba712c78931f89b1","observation_id":"8c4996de-1346-4b70-a7d6-06e9f565ddd7","resolution":{"observed_at":"2026-08-12T15:46:34.069591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.631385Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"4f1bca84-fc0b-4239-a917-6e7d6b5e7531","year":2022},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.072992Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:536aea648a7dbe2e84df5ad37cc12ad362f12af92da85f234ed806fba7764e76","observation_id":"1174f455-31c5-4ed0-948c-9c7b642a567f","resolution":{"observed_at":"2026-08-12T15:46:34.635444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.076530Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.076530Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:0f7facc095d705a02fdde47f6dafa08c4f834527d3aa8772a2418d5783a173ab","observation_id":"71cbe1a5-0956-4492-b4c4-7d6b114981f4","resolution":{"observed_at":"2026-08-12T15:46:34.076530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.079946Z","title":"Valley: Video assistant with large language model enhanced ability, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.079946Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:9a5783ee9cbb31a425509bb3539c61fa9e55d44ec20f9c04cb299c555d843244","observation_id":"246e3dfe-457e-4f15-ae4a-7c4edb6b7597","resolution":{"observed_at":"2026-08-12T15:46:34.079946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.605470Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models, 2024","venue":null,"work_id":"3157b84a-2cf7-49a9-b1f5-1d20a18bd3e1","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.083458Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:29f7697212cde571c07fae003635fae48317ee58c4fa98a317ff8524d8ed71ae","observation_id":"19f0d48a-eb54-4200-943a-d996aed2b9e5","resolution":{"observed_at":"2026-08-12T15:46:34.609308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.594288Z","title":"The surprising effectiveness of multimodal large language models for video moment retrieval, 2024","venue":null,"work_id":"2b657025-8ae2-4423-9492-04346b7b1937","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.086941Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:e86d77b6e919ac269dd259703bd0b9e00f0ba547fbabc80b769bd43c279a67d2","observation_id":"53832ca4-6755-4aa6-bf0a-05ee22e796cf","resolution":{"observed_at":"2026-08-12T15:46:34.598219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.582739Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection, 2023","venue":null,"work_id":"5cab16b3-174c-4515-81e0-e9f74a7d006d","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.090381Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:b4d349496a10fa2110f45df0fdbdd234f50538f31af02824aea2290307d5d698","observation_id":"b2bb8faa-3cb8-4b76-9c4a-eb24a7479be3","resolution":{"observed_at":"2026-08-12T15:46:34.586889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.571650Z","title":"Correlation-guided query-dependency calibration for video temporal grounding, 2024","venue":null,"work_id":"15c1e05b-57e2-4d12-91a5-de9e8a58e5d6","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.094038Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:26820e1950f9076e2736fb446ba520ce01efe03ba8e653917299a6ff631df395","observation_id":"fd5efcf6-9441-4802-8a47-4cacf6a24796","resolution":{"observed_at":"2026-08-12T15:46:34.575592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.560582Z","title":"Local- global video-text interactions for temporal grounding","venue":null,"work_id":"93d36dcc-9f61-4147-8a4c-56c6b7a66bb0","year":2020},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.097533Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:d65fe6bba709a7767b5fa765cebc46546d5afa4d3e62926d9e9d103fcca8c6bf","observation_id":"8770941d-1da9-4a76-9b6a-9742bc443b62","resolution":{"observed_at":"2026-08-12T15:46:34.564426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.548933Z","title":"Pat: Position-aware transformer for dense multi-label action detection","venue":null,"work_id":"7cf4c58c-b09a-49e5-835c-025f6b8d0ab9","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.101057Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:79b0980522d99b3a5bf69f02dd1ab3ca7df7094805bbde4ed10817336cfa058e","observation_id":"04bc2f47-7523-40fb-8322-ba84ceab1104","resolution":{"observed_at":"2026-08-12T15:46:34.553015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.536975Z","title":"Temporal action localization in untrimmed videos via multi-stage cnns","venue":null,"work_id":"2213cc42-8e7c-47b9-8be8-0f67781561fc","year":2016},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.104973Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a6877b4175b9e231fa31292c5db447d98fef47ee31178572a708c2245dedbe32","observation_id":"0fd47542-75b4-408d-8759-a2762961bf45","resolution":{"observed_at":"2026-08-12T15:46:34.541275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.526038Z","title":"Vlg-net: Video-language graph matching network for video grounding, 2021","venue":null,"work_id":"188b0990-54dd-45f6-87d8-42039bb60608","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.108323Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:8b41ef1361336ebea9fbad94db749aa614b2563b876b0ab19861aecb92c2455e","observation_id":"06cf80aa-567e-4be8-b43b-a2f20b646461","resolution":{"observed_at":"2026-08-12T15:46:34.530151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.515485Z","title":"Learning grounded vision-language representation for versatile understanding in untrimmed videos, 2023","venue":null,"work_id":"5cfbb090-a5e9-4038-ab59-f2d244f2c9c6","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.111758Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:59878540c27b6a6388bca93d5c6f7713b5def6ad7cac898082f8d91cb6ea7562","observation_id":"2c06cbe0-62ce-4cf3-9857-2154ddbc99f1","resolution":{"observed_at":"2026-08-12T15:46:34.519074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.505411Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding, 2024","venue":null,"work_id":"37d94d01-53a1-4e04-92a5-873efbdeaee7","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.115164Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:be7b2f985de668480469d49b6ef9b560dbe0b9fe3ab010698474d4a14a7e7eb4","observation_id":"a557d774-50bd-472c-a27d-9ebbf57e4a13","resolution":{"observed_at":"2026-08-12T15:46:34.508781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.495533Z","title":"Unloc: A unified framework for video localization tasks, 2023","venue":null,"work_id":"a4da9015-6f04-4020-9890-d898b5a31bb4","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.118300Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:2749a02ce04eae495dd690a606b012a46b65e5c8e401aa3f9d738921dc5ff2c4","observation_id":"70727b54-4d97-42c4-8ec7-9bdd134efb16","resolution":{"observed_at":"2026-08-12T15:46:34.498670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.485341Z","title":"Unloc: A unified framework for video localization tasks, 2023","venue":null,"work_id":"193c38f1-806f-485a-9bf3-49ed2bd1384f","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.121669Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:2f6490872addb18f23a86fb2e2dc3b692e5a1ec5bbf47dc28537ced75124eeb5","observation_id":"b175bed0-7f32-4ac1-836d-2ab0537235bd","resolution":{"observed_at":"2026-08-12T15:46:34.489049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.474720Z","title":"Self-chained image-language model for video localization and question answering, 2023","venue":null,"work_id":"cfc6726f-2398-4971-a862-b8a429971d62","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.124891Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:d072d03fbaa310ddb3d9dba9744aef9a3b7b1a8f71fdeb4a83f7d95fbafcae63","observation_id":"99495fa3-ae96-4f4d-b2a3-a1b32e1025b3","resolution":{"observed_at":"2026-08-12T15:46:34.478605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.462469Z","title":"Semantic conditioned dynamic modulation for tempo- ral sentence grounding in videos","venue":null,"work_id":"2cbe7c01-5535-468e-9095-3f00534fb0dd","year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.128070Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:06728d395161d61fdd5938f6209631af7eb2b43829e164c59ad32d1c6f1ed113","observation_id":"53683c38-2ee5-42a1-8334-a5ccb8a990e7","resolution":{"observed_at":"2026-08-12T15:46:34.466924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.450809Z","title":"Graph con- volutional networks for temporal action localization","venue":null,"work_id":"2e1460ce-52de-4fe3-a19e-88ac054c21b1","year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.131043Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:a1c3ccfe77ba3d16a59eee7ea9cf8dffedd2ae0aae895ef417df06c2cb1da498","observation_id":"3c4a4bbc-5325-4133-a3cd-864e8e3d07e4","resolution":{"observed_at":"2026-08-12T15:46:34.454748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.439644Z","title":"Dense regression network for video grounding, 2020","venue":null,"work_id":"009a8dc0-70cf-4825-aef6-e900e69e6da7","year":2020},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.134371Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:8892d361f7d32e0fd1ca1ee9a385371bf13a2c33c502be8767352162d98fd0e4","observation_id":"abe0109e-633f-4829-b1b3-f1ac251df33b","resolution":{"observed_at":"2026-08-12T15:46:34.443580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.428548Z","title":"Unimd: Towards unifying moment retrieval and temporal ac- tion detection, 2024","venue":null,"work_id":"f00e72be-b95f-43d5-8f1d-8d0103e57de8","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.137745Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:54e025b530e07efb4211687f6f187537b89a9942a53f8170a266f5f3cee4a78a","observation_id":"16ead2ca-91f5-4d79-b4ce-19ee17466dc8","resolution":{"observed_at":"2026-08-12T15:46:34.432557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.416876Z","title":"Actionformer: Localizing moments of actions with transformers","venue":null,"work_id":"2ea31fc5-c96a-489b-b1fc-25239067ab8a","year":2022},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.141472Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:da3fe89aee14dba0618f5f4e8cc2a3aca77e3780176e1442ea4d75c8fb6e68eb","observation_id":"6ffe070f-1deb-4aa9-bb1e-af6a2e1b46bf","resolution":{"observed_at":"2026-08-12T15:46:34.420874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.404982Z","title":"Man: Moment alignment network for natural language moment retrieval via iterative graph adjustment","venue":null,"work_id":"39a0e772-28c7-4466-aaa2-672f179208ed","year":2019},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.145028Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:8b1d4f7bec64c1210eadd401d44b88c5623350afdc3e75926b9c180801463052","observation_id":"88ccc7a2-1faf-4697-a385-08e9d72ead34","resolution":{"observed_at":"2026-08-12T15:46:34.409042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.148600Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.148600Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:7d776f870064f2c009c8cf20649bd146483ea78aba5068a446bab2d421b6b868","observation_id":"fb139d1d-1b80-4db8-8346-44fa833f7abb","resolution":{"observed_at":"2026-08-12T15:46:34.148600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.387264Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention, 2024","venue":null,"work_id":"e95c93e3-167c-43d5-b8f2-edfebb4fd1ff","year":2024},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.151866Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:f7609c9c168b676ef67424b220357b1fc177c60ed15ffcdb29f1dbd548807701","observation_id":"d70a4ef0-1d32-41b6-810f-abe85ea0bf88","resolution":{"observed_at":"2026-08-12T15:46:34.390918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.155307Z","title":"Learning 2d temporal adjacent networks for moment local- ization with natural language","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.155307Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:b2f0b9c179876efcb725ad7d45c088c14c42c94c69029ed7d8257a39ec11c526","observation_id":"30d3c546-e572-4a63-9f0f-244e97c6613a","resolution":{"observed_at":"2026-08-12T15:46:34.155307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.368929Z","title":"Temporal action detection with structured segment networks","venue":null,"work_id":"eaaf82be-20a2-4205-bcf1-159a6f19809a","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.158791Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:ef2d327191cf7e0abffd53a3e30e2e7777e688eaa36b7e942b35d8c94c9b8e35","observation_id":"0ce4def2-55cd-43a5-945e-ae64f5ff87d1","resolution":{"observed_at":"2026-08-12T15:46:34.372984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.358188Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":"64fc98b9-5bed-4dd4-acaf-9589c4157059","year":2023},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.162165Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:08fd5953ff842c75220da9cafacd18393b916de9b43badbe1703a233091ff42e","observation_id":"8b0f7f74-0fa9-4704-9eb2-de4b3c8e6e6d","resolution":{"observed_at":"2026-08-12T15:46:34.361880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.346840Z","title":"Enriching local and global contexts for temporal action localization","venue":null,"work_id":"42aa4ccf-526d-461e-8ae3-9b84587564f6","year":2021},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.165559Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:427b68ee02d46c04b512891061b76482a4bcd8c692151012f41858bafd41a006","observation_id":"f7d3ba55-d9ba-42ae-ad0c-cea89989a227","resolution":{"observed_at":"2026-08-12T15:46:34.350436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.336058Z","title":null,"venue":null,"work_id":"ce55adf8-04b3-43e6-8c4b-b4beb1d1996a","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.168963Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:9ebb50153cdbe5fba68ed1b7af0ab358dc5c7757f88f45192bfca25b42a12d2b","observation_id":"a8e99c9d-6d27-43a4-8ffe-5dd551089ade","resolution":{"observed_at":"2026-08-12T15:46:34.339358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.324820Z","title":"[[-1, -1]]","venue":null,"work_id":"5832e244-161f-495a-b63e-b5407c44b305","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.172906Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:ff2fa8fe70df22d19b85dacdabbea30346042de2dda271906f9e2bbc663ab76a","observation_id":"5eab3430-918f-4c82-ae81-aed16842eb78","resolution":{"observed_at":"2026-08-12T15:46:34.328503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.313389Z","title":"automated devices operating in a modern factory","venue":null,"work_id":"f0d975d8-d3c6-4adc-8ad7-fc32a6dc74d5","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.176858Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:89e16cdfe5d1b8ebda3f6d5ea268bbbc285fcf3f372987e1c3012cc61b779bcc","observation_id":"7c2b5e37-9af4-4a0b-9e1d-3aae182d0e2f","resolution":{"observed_at":"2026-08-12T15:46:34.317235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:46:34.302010Z","title":"This section explores po- tential future directions for enhancing the performance of MLLMs in moment retrieval tasks","venue":null,"work_id":"bc110c16-6830-4010-bd49-1b20d70df249","year":null},"citing_paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T15:46:34.180369Z"},"links":{"citing_paper":"/paper/2411.14505"},"observation_digest":"sha256:110f07687789647afa06c3d6b570dfe050fafc5139525d4d062d6f14ca69696b","observation_id":"8500c787-c420-47b0-81e9-08b5dc4e9d88","resolution":{"observed_at":"2026-08-12T15:46:34.305958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14505","last_updated":"2024-11-21T09:34:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T07:55:35.415892Z","submitted_at":"2024-11-21T09:34:23Z","title":"LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 7 inbound Pith citation observations for arXiv:2411.14505."}