{"as_of":"2026-08-10T00:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc5ba6d0535e08429ff64548a434dfafc06cf3ad5caa475e39961384977d67dc","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:30:37.955324Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T19:27:29.843866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:06:08.881592Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"cited_work":{"arxiv_id":"2508.01699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01699","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7b9e2227-9cac-4582-9077-538f60775f15","year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T12:45:50.422679Z"},"links":{"cited_paper":"/paper/2508.01699","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:ded1d62f03d253f9896f667d55a54d6c5b7e0520625e92691d36c5c73536d068","observation_id":"8ca6f62c-11c8-46a6-8623-e65dd0c21a46","resolution":{"observed_at":"2026-05-11T19:06:08.883921Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.01699","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2508.01699","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:2770fdbf353c75d6e4a37adbee75d07205f844c5046933625800e23fedecba7d","observation_id":"a4663677-3956-4d70-991c-cadd2285c595","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.01699/citation-record","integrity":"/paper/2508.01699/integrity","json":"/paper/2508.01699/citation-record.json","paper":"/paper/2508.01699"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.998764Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":"d6e8000a-795b-419d-9c1a-34b0182fe4a0","year":2005},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.412600Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:fd667c8429fe402c10d78fb560d42ecb0e604df379a3d4de5ed8186dde968d11","observation_id":"623f6c64-f604-4f32-8938-a8446102c4c8","resolution":{"observed_at":"2026-08-06T05:30:44.003791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.982730Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"5a147550-c184-4a21-bbfb-45c93eaca1bf","year":2015},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.531809Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:ef220bc0da0c15e544209f85ada0f97ec03aa13aab990d11efa14e2278c34860","observation_id":"05c00db8-871c-4775-a3a2-3c3ce4dec1b0","resolution":{"observed_at":"2026-08-06T05:30:43.987971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.966082Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":"ecaf1e8c-fa19-46e1-8de9-085548f01ac4","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.609028Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:1dacd4d26461df4d5f9584f81ac7210c9a8bd6ee8fc5b0f5e945c5d868cd5790","observation_id":"c78fdb2e-00a1-4b18-bd51-4781f388e678","resolution":{"observed_at":"2026-08-06T05:30:43.971860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.949183Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":"ed497ac2-96f7-413c-9106-f54d9c1c31ed","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.692548Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:d0319648a4ac3c0daee4e119027917d4a0cfc947d251b3e7d9c778394c39299f","observation_id":"d594ea80-d3fa-48c4-b294-be2a229abc9a","resolution":{"observed_at":"2026-08-06T05:30:43.954786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T05:30:33.778727Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.778727Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:6fc29d94b28cd1de5628bf291175eea32c5b72987a6e4f0aee206c586855c350","observation_id":"3ef79b53-06a9-4b21-9f6c-85d5dd158b02","resolution":{"observed_at":"2026-08-06T05:30:33.778727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.932929Z","title":"Uni- fied scaling laws for routed language models","venue":null,"work_id":"36b44b0e-7b9b-4ce6-87b4-031c01a97f1c","year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.858259Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:600dde81b7c38c51f379b53193f14b4a59f1389711bbe2c7c767eab1419b54ec","observation_id":"b9a04bde-8af6-4c7d-b103-ceec727b8e87","resolution":{"observed_at":"2026-08-06T05:30:43.938058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.916439Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"a50399bd-d20b-4f4d-8464-18164dfec56b","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.901509Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:3738d7adf5a4260b134b0a0d4a57dbf6504294e0483a5a1d6093fd328b60277c","observation_id":"1a072bc1-35a1-4940-a54e-7d53b065ba84","resolution":{"observed_at":"2026-08-06T05:30:43.921880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.4314","last_updated":"2014-03-09T20:15:03Z","snapshot_observed_at":"2026-07-06T03:30:57.897408Z","submitted_at":"2013-12-16T11:15:10Z","title":"Learning Factored Representations in a Deep Mixture of Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.4314","snapshot_observed_at":"2026-08-06T05:30:33.960108Z","title":"Learning factored representations in a deep mixture of ex- perts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:33.960108Z"},"links":{"cited_paper":"/paper/1312.4314","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:63ed80580d344cb61f06d84e196f33dde5a56215468ca8bf187b5b3ecc7e809e","observation_id":"f6ea2427-d8b2-44f8-9eec-6ee7fca202fc","resolution":{"observed_at":"2026-08-06T05:30:33.960108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.900369Z","title":"To- wards an empirical understanding of moe design choices","venue":null,"work_id":"33c969ec-9ae7-4823-9ce8-02238d707f5a","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.049822Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:29a815f2de2d8940501eb36f871b9ae8a56cd4b69c3b2e6ebc61ea12b8bf6664","observation_id":"c0c05667-94c4-484c-95d8-f322f64d16cc","resolution":{"observed_at":"2026-08-06T05:30:43.905539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.883553Z","title":"Switch transformers: Scaling to trillion parameter models with sim- ple and efficient sparsity","venue":null,"work_id":"66de8aed-cb2b-4ada-ab98-f80bb2a5ac81","year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.155000Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:b06d2d2d81aa7db497dfb638e0f09a15c1830ba4139bf0a77787b2d6a53bee5d","observation_id":"157887cb-5000-4b81-8b97-0f9409a752e7","resolution":{"observed_at":"2026-08-06T05:30:43.890185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.866997Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"5e5ce235-06f7-4004-8ed1-4473fa69f292","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.195738Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:1b9eb3885a95b470d4bd85ffed5c03e455331da74766a2f7dee178ff33cb1223","observation_id":"1113bebe-bf15-4fd8-894d-e77ba17abd5c","resolution":{"observed_at":"2026-08-06T05:30:43.872370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.851184Z","title":"Soda: Story oriented dense video captioning evaluation framework","venue":null,"work_id":"142d9996-da2a-4dcc-8105-3c3d32266903","year":2020},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.229575Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:9342fb3f4f23f2dea0ea98d4ede83fee26deffb200d0307ae5a080a2f118273a","observation_id":"3df24c47-2fca-46c6-abe5-2bc47edf56da","resolution":{"observed_at":"2026-08-06T05:30:43.856269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.834528Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"e7911e39-9568-413d-854d-ea3fcf580800","year":2017},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.278365Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:5ff925f1791a94024c4e02aabec96a6c6cb9519547bce838dbf86bcbba6b25aa","observation_id":"605203f0-9526-4c6f-9f37-717c149fb719","resolution":{"observed_at":"2026-08-06T05:30:43.840107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.816274Z","title":"Dynamic mixture of experts: An auto- tuning approach for efficient transformer models","venue":null,"work_id":"2c01df65-80d3-4188-993c-526fbdef64c6","year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.391428Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:c731e17e118d5ec19333e46272af6b7bf5e96a6cdbf0cdaa5eafcbf8b53f89a0","observation_id":"093ce128-28cb-4f61-8c89-8d03aad676a0","resolution":{"observed_at":"2026-08-06T05:30:43.821904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.798941Z","title":"Vtg-llm: Integrating timestamp knowledge into video llms for enhanced video temporal grounding","venue":null,"work_id":"035bec78-5d75-4a78-b6e1-5c41c00b094f","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.460788Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:cf9e2271b87d30151478afdc904d14ef67bca35e09fe4c65ee79c588bc292bda","observation_id":"6889abd9-af84-4ed9-bb06-8b189a4ebf88","resolution":{"observed_at":"2026-08-06T05:30:43.804342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.781206Z","title":"Trace: Temporal grounding video llm via causal event modeling","venue":null,"work_id":"27a1bb6c-2276-4425-91cb-efcd6e4f338c","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.482059Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:12c8a794afa430e01af0d1a3fa988dbbb085d38b4278c420330352b7bba42b93","observation_id":"a1f15d89-1ff6-4c8b-871f-0de6772c6963","resolution":{"observed_at":"2026-08-06T05:30:43.787199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.763980Z","title":"Creating summaries from user videos","venue":null,"work_id":"9c9a5e7f-0616-4470-8d24-5ca8887039da","year":2014},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.561469Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:9bc1f7cdcc1e679c0b853f682dc2e7e32cc461579c869ef38a592188c4cbf30a","observation_id":"131fdcac-9151-4a86-b262-05f56902c143","resolution":{"observed_at":"2026-08-06T05:30:43.770016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.746720Z","title":"Unleash the potential of clip for video highlight detection","venue":null,"work_id":"06c06dc8-663b-48a1-97cc-625ebc49fa36","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.659566Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:63d37838785b61c272556919561fe8a093e7d2735ed4add3fce6b46e6eb2e760","observation_id":"17d0bea3-7751-402c-b7f0-41c96bcaaf06","resolution":{"observed_at":"2026-08-06T05:30:43.753155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.728941Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"b29e90ca-055c-4c65-b27c-31842d08a52a","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.719234Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:853eaed0d0a035cbce94862bb14967e704fd8ebfc495738aaeb10bf4573493b0","observation_id":"eb98ddcc-bbff-493f-8710-4580b8875508","resolution":{"observed_at":"2026-08-06T05:30:43.735002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.712739Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"e72f1051-7245-425b-b1b6-d4b5fffd3cf1","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.745891Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:a3af7d420781a843f67d85de55d78d155fb0cda54e2588a9bd6edaa322ba0ef4","observation_id":"2f14ab98-16ba-440c-ac4c-2eae1cc543bd","resolution":{"observed_at":"2026-08-06T05:30:43.717956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.695735Z","title":"Harder tasks need more experts: Dynamic routing in moe models","venue":null,"work_id":"93b941bd-b4d6-4346-bbaf-26a437029bbe","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.788888Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:3a2ca4cfc60778c459fc0abd6a97cb57b7f4876cd716950ef9ad35b9861792bf","observation_id":"ea59856b-3465-421e-893d-13195462547c","resolution":{"observed_at":"2026-08-06T05:30:43.700576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.678877Z","title":"Do you remember? dense video captioning with cross-modal memory retrieval","venue":null,"work_id":"65fe7ab7-3f11-4ffa-a0eb-318ca7c318fe","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.845670Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:357695260206a68f33d7f69dd2bf26e9a8ed64716bd508478b31257ad7e26853","observation_id":"2b6eb25a-64d9-42c0-b027-0f29de08ed76","resolution":{"observed_at":"2026-08-06T05:30:43.684117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.660258Z","title":"Dense-captioning events in videos","venue":null,"work_id":"17a0c723-043f-43d8-a02b-6c51da7d308c","year":2017},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.928179Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:ec0a226f83270e2b016e0250f983f72b4c0cdecc47f0146872833637fd9c8607","observation_id":"087627ca-d238-4b66-b779-31be644de0bd","resolution":{"observed_at":"2026-08-06T05:30:43.666589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.643798Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":"423b4ac5-f5d1-41ff-853a-6192e0d1a1cb","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:34.980675Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:7b5d90d2c416d4b9e38a814634e40edb0cebf97e4b28b56cd0f18e0b574db699","observation_id":"0d490c18-b50d-4187-83f2-910cd91a7aa5","resolution":{"observed_at":"2026-08-06T05:30:43.649257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T05:30:35.065340Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.065340Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:89d55567da6cc6af3a8a3744763ad14984314b9190fa90163ba001f2b35e5027","observation_id":"25639214-899c-434e-956e-1357c905573c","resolution":{"observed_at":"2026-08-06T05:30:35.065340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.626831Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"dbefe6b2-b13b-4c1c-9d6d-1db1202bf93e","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.126090Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:5ef4545a1d9cbc6e5ff4454f9db3bb0c4c039055d4e91b0065bfd0368301094a","observation_id":"f1aa857f-33c9-40a7-b022-50c49599aa1f","resolution":{"observed_at":"2026-08-06T05:30:43.632430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.610095Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":"9c376a64-f66d-4dcb-81ff-bd812cf3654a","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.192935Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:35311e68ce280c69cd188e34c61e577d501cfb859f5100bcbfe0458765142232","observation_id":"17249dd6-7a2b-4b77-bdc5-01035a740a7d","resolution":{"observed_at":"2026-08-06T05:30:43.616051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.594506Z","title":"Uni- moe: Scaling unified multimodal llms with mixture of ex- perts","venue":null,"work_id":"afd95002-ac3f-4b69-b232-d647cefad8da","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.268512Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:e06f2f0f244000d43183975e3600f5b16e98c8dab65032446b7ba2806d620b8d","observation_id":"38d5f266-c7c9-4f71-a086-1d79f9b2507a","resolution":{"observed_at":"2026-08-06T05:30:43.599390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.578009Z","title":"Video-llava: Learning united visual repre- sentation by alignment before projection","venue":null,"work_id":"8c24ceda-13bb-43ed-84e4-4718c90ad5bc","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.379944Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:f1e4fc2d75165ec1fddf47ee058420ac3d1a7af2642f83adb98911bf811afe5f","observation_id":"0bf732be-fc47-43d5-94dc-a48d507c7e89","resolution":{"observed_at":"2026-08-06T05:30:43.583338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.355783Z","title":"Univtg: Towards unified video- language temporal grounding","venue":null,"work_id":"b522db6b-2770-428d-a9d5-45ed0b1438b6","year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.452520Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:2ee19fe809b99d72faf045495fa8b0ad2550ab1f503b26fc10f6729f7b4953a0","observation_id":"74721bab-b9d3-4406-83fb-14975db5b8d5","resolution":{"observed_at":"2026-08-06T05:30:43.566814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.189150Z","title":"Visual instruction tuning","venue":null,"work_id":"15382f2a-c537-41e7-ad72-b98338527074","year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.516888Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:ee4d49c4f7c5825371571ec2d981a9d2c0c4076623f3e8937c7e6b6c3cc58128","observation_id":"3919a88f-713a-407b-b5e3-5031f14b8e5e","resolution":{"observed_at":"2026-08-06T05:30:43.270070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:43.049767Z","title":"Umt: Unified multi-modal transformers for joint video moment retrieval and highlight detection","venue":null,"work_id":"32cfd00b-aae5-4f96-bab7-474d1e09535e","year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.562812Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:5fc1932188a75d973226d7a5166436cb5931e4a0202f0f84c226909853617dd3","observation_id":"6fa5e354-bf29-4290-84af-8d37a5a3f3be","resolution":{"observed_at":"2026-08-06T05:30:43.095980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T19:40:57.491981Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-06T05:30:35.652829Z","title":"Valley: Video assistant with large language model enhanced ability","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.652829Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:1bcb8854f778ed251fbf4eb1b186bdb24c6af2fa1d82dfab7ea7542bbf9f6fb4","observation_id":"f21d3b11-8dd8-4f2a-8183-1df5bf4165df","resolution":{"observed_at":"2026-08-06T05:30:35.652829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.870991Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"d3e2755a-a35c-45c3-8827-5f174c2c8ce5","year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.721302Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:38d26cf3bc6b66185995b8116b323cd805e13054815796bfcce661c880c080af","observation_id":"4f7a096b-b4d3-44bb-8fae-6767e6fa3049","resolution":{"observed_at":"2026-08-06T05:30:42.962184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08835","last_updated":"2024-07-03T18:05:02Z","snapshot_observed_at":"2026-08-09T08:22:44.755451Z","submitted_at":"2023-11-15T10:22:35Z","title":"Correlation-Guided Query-Dependency Calibration for Video Temporal Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08835","snapshot_observed_at":"2026-08-06T05:30:35.805762Z","title":"Correlation-guided query-dependency calibra- tion for video temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.805762Z"},"links":{"cited_paper":"/paper/2311.08835","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:4894e127b164c1e246b7c53d33b0586c0cbc3070a6b7f084d66123a5afe34211","observation_id":"aad3652a-5708-4e5d-8c17-6efe370f64ca","resolution":{"observed_at":"2026-08-06T05:30:35.805762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.737222Z","title":"Query-dependent video representa- tion for moment retrieval and highlight detection","venue":null,"work_id":"20b3244e-b4f7-4a95-a3c5-1cd2a3e59016","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.859524Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:d4809769558c41aa3c0edc13b2f26f0b64a1b61f270ffc58932e25ed5523343c","observation_id":"946c2b1c-897d-422a-a44e-bf2b23a11a99","resolution":{"observed_at":"2026-08-06T05:30:42.861021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.517050Z","title":"En- coding and controlling global semantics for long-form video question answering","venue":null,"work_id":"7430ec1a-d6c4-46f6-aa0c-4dd32d9ec126","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:35.945738Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:bc96e44911ab4760f343fbaef3bea30f80efdf6a50af4c723df57d32bad7b965","observation_id":"951b66dd-ded4-46e1-b914-0e7ae09582af","resolution":{"observed_at":"2026-08-06T05:30:42.691002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.179840Z","title":"Queryd: A video dataset with high-quality text and audio narrations","venue":null,"work_id":"5f9f0361-b733-4785-94a3-478e6e27954d","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.024923Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:ae4b35104fddff4d8b46e8cb18e71605f622754adadc50636bb975f79cccbf1f","observation_id":"5d933afe-c99b-4224-ba99-330958abac2c","resolution":{"observed_at":"2026-08-06T05:30:42.342649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:42.010615Z","title":"Momen- tor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":"56a7bbeb-003c-4617-b6e3-64f7506e1770","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.097163Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:449b79cf97f3ebe4f6197f505b41a2a34729bf195d3b245351f2b356acf8d869","observation_id":"d99fb04b-5f3b-4521-9298-0da608427cec","resolution":{"observed_at":"2026-08-06T05:30:42.092397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.826200Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"c8c3ce2e-1270-4cfa-af60-53afa0b7a9de","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.191091Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:7e12b9837688bb7c4aafbb3d74a490306b195c20abc7ac2986bbfe1f4a9cccde","observation_id":"5147b790-31ef-4d86-aa40-411c7b036680","resolution":{"observed_at":"2026-08-06T05:30:41.922959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.632680Z","title":"Outra- geously large neural networks: The sparsely-gated mixture- of-experts layer","venue":null,"work_id":"67d277d8-21f6-4dea-8108-c992873ffb0f","year":2017},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.236316Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:ca3f1bd949ad816c7bbbdce114285ea5396bfade38d4efa7be7e4bd66d38fd82","observation_id":"d5300c57-1ae8-49f0-8ef3-53426d8d5c33","resolution":{"observed_at":"2026-08-06T05:30:41.737786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.442129Z","title":"Tvsum: Summarizing web videos using titles","venue":null,"work_id":"ee9a40b1-4eed-463e-9083-7e29c0832e72","year":2015},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.311506Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:e04ca16996a771b8155b9e549f789f3eb7b9bfd548421df33572ce07995f98e2","observation_id":"e0ed41b6-1d91-4256-9b4f-85882b0e8c6e","resolution":{"observed_at":"2026-08-06T05:30:41.545662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.246987Z","title":"Coin: A large-scale dataset for comprehensive instructional video analysis","venue":null,"work_id":"e4738ed4-2319-46b7-9dc2-1e8b39ab1e5f","year":2019},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.406795Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:bed87f87feac50a7d6e90c8930197aed0aef66737b430cf827f7d0f580049be0","observation_id":"fe940160-b914-400f-ab09-e401a411b2b2","resolution":{"observed_at":"2026-08-06T05:30:41.321973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:41.065701Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":"2d203e19-5393-4005-9169-f4a5d83aaa5a","year":2015},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.468685Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:ac901b167c2299daec0e4e6f9eb19701167f74a3f1ef07d093bb15285d26f8cd","observation_id":"b25f3dc0-f091-4f80-a22d-fb0b32701f85","resolution":{"observed_at":"2026-08-06T05:30:41.139740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T05:30:36.525254Z","title":"Grounded-videollm: Sharpening fine-grained tem- poral grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.525254Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:f21f271bd4905e61cf68647bccdb0ed0070f8b45455c78544fef22b484ebbb86","observation_id":"cb8d8afd-6d9a-4832-a6ef-ffdc5fd7d998","resolution":{"observed_at":"2026-08-06T05:30:36.525254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T05:30:36.592742Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.592742Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:8cea11c059cf81f0908a64f4915ad2c2b419439280d42e201f5c0e09fa8bdb04","observation_id":"93fa13a4-7f4b-47c4-a171-aad8de3a708e","resolution":{"observed_at":"2026-08-06T05:30:36.592742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.861808Z","title":"End-to-end dense video captioning with parallel decoding","venue":null,"work_id":"c77a2d9b-6dbd-48ff-ba78-af64c86528e2","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.628329Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:7ec5bdb5b5b14926d54f505900896a65284e98da8134b53ed2397f7e523771a1","observation_id":"d2919905-838c-4982-8446-f1457ca57e9c","resolution":{"observed_at":"2026-08-06T05:30:40.943395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T05:30:36.666749Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.666749Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:c718c6b17313d8956f3dc5f08431e92c925a7c616da5b65759dd482a61707485","observation_id":"d3969c71-fd3e-4fd9-a942-9c16d6e17c84","resolution":{"observed_at":"2026-08-06T05:30:36.666749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-07-06T17:45:11.343569Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-08-06T05:30:36.705649Z","title":"Hawkeye: Training video- text llms for grounding text in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.705649Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:0c3e2788abc6e73236e054e1910c3b0bc66cc333f4f1f1f1bc3bc1d0047954e4","observation_id":"87fcc106-ab07-4f0a-8792-1a6c1b708276","resolution":{"observed_at":"2026-08-06T05:30:36.705649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.668103Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":null,"work_id":"da7235c9-e536-4364-982e-84e22b399e05","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.758678Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:7da904a5f0036ad8f4e71640bae30b44717dd1f4a14dd213555118426754ef28","observation_id":"b558d7db-a77f-49b3-bc16-66330f50fb08","resolution":{"observed_at":"2026-08-06T05:30:40.747026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.493705Z","title":"A large cross- modal video retrieval dataset with reading comprehension","venue":null,"work_id":"7dd4da6c-06fc-46a4-b5df-b03797bfa668","year":2025},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.832418Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:0aa8508393cc7ecb3b3b29fa167e6b75325f3fd044f6c1d59d00428c7d3a047f","observation_id":"3726fe4c-6468-4c6f-bd24-70914bd28998","resolution":{"observed_at":"2026-08-06T05:30:40.563938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.319893Z","title":"Multi-head mixture-of-experts","venue":null,"work_id":"3178c8c5-6e5e-4cbf-9270-d582e296cc9a","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.911944Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:ed93c6bc113dd6cf4ea7c7f0352b2d90bbd3214c6463aca47e1b673c48da3be0","observation_id":"63d58ae2-fa10-454f-98de-3299a0f51c49","resolution":{"observed_at":"2026-08-06T05:30:40.392301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:40.157407Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"97cf8e56-ae28-4176-a356-fac19a9faf8d","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.976754Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:dc1296b35d886a0f2e4ec293bfce656ad72865e84d3ffbe5f18b85e219550ac6","observation_id":"4c366bce-39e4-4cd0-8593-0e30cda2ded0","resolution":{"observed_at":"2026-08-06T05:30:40.224920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.905207Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":"57bbf09e-b4f2-45c1-82d2-179ec6023035","year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.021922Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:bfc4ff19a52338dbddfb772da7df14da2e9c1744c580299c26af5c5a10691f05","observation_id":"ba09c676-ddfd-4cd9-a31b-72a8c20d5874","resolution":{"observed_at":"2026-08-06T05:30:40.028153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-06T05:30:37.087279Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.087279Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:bea4d4689255959ab0dce0862c06932f8a3336c2f4accb5dd6b631105b08e2c2","observation_id":"7af50d6b-ec72-4721-b2f1-72a2dbe5712b","resolution":{"observed_at":"2026-08-06T05:30:37.087279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.15082","last_updated":"2021-08-09T15:33:59Z","snapshot_observed_at":"2026-08-02T18:00:42.430439Z","submitted_at":"2021-05-31T16:12:44Z","title":"M6-T: Exploring Sparse Expert Models and Beyond","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.15082","snapshot_observed_at":"2026-08-06T05:30:37.167043Z","title":"M6-t: Exploring sparse expert models and beyond","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.167043Z"},"links":{"cited_paper":"/paper/2105.15082","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:6b4796756f6a2c0a0c8b47d1f8339f0ba2253eb726df04bf83a92b7d1b42396f","observation_id":"ea7a8c66-e388-4263-897b-46e884175c77","resolution":{"observed_at":"2026-08-06T05:30:37.167043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.643624Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":"16a502d3-ddf8-49f7-928f-a7797180f10f","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.242864Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:2389d86aea0ed0741c3e893b1abc2484cc0831617f8d92c711ac7eaffcff020d","observation_id":"851e325b-d961-44ab-8b75-d640d8e482e4","resolution":{"observed_at":"2026-08-06T05:30:39.774822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.374642Z","title":"Xmoe: Sparse models with fine-grained and adaptive expert selection","venue":null,"work_id":"63823d59-95f3-44f2-baab-617dd5674829","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.309509Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:5c87b493c783901b6c0c147515eb90e62aeb16f8e2b2960378859ce20f6b638d","observation_id":"5a8dcb2a-b125-4ab5-81b9-631efe2ed276","resolution":{"observed_at":"2026-08-06T05:30:39.469525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.183763Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":"4609f792-d543-4f66-9a59-58ffcd898eba","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.434673Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:8895db0be3c894684ffb03e0e397b22611556069dfb329f0123ed83ca4eaf2ad","observation_id":"e3580b97-3d5a-4a1a-8e90-e0f4f2709d2b","resolution":{"observed_at":"2026-08-06T05:30:39.278032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:39.018889Z","title":"Unimd: Towards unifying moment retrieval and temporal ac- tion detection","venue":null,"work_id":"9a034a43-5560-4c1b-a1ca-052783c68b5c","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.530612Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:89a5e841430dbf3fa0042525430758732a56e6bbbce341e03174fc299bcb9a4f","observation_id":"4aaf3c91-7ccc-49bc-a41f-3d144cf8a627","resolution":{"observed_at":"2026-08-06T05:30:39.112892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:38.766650Z","title":"Adamoe: Token-adaptive routing with null ex- perts for mixture-of-experts language models","venue":null,"work_id":"6b11c4cf-250a-4395-b9c2-9bd6154cc9b1","year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.591682Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:34630ac7b41fc650604707a555dd3856cec2121828cd89022562f2bf29146e7b","observation_id":"446f505a-9a3c-48ad-b300-2ea55a96d67f","resolution":{"observed_at":"2026-08-06T05:30:38.881163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:38.527694Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"f96ae029-7b87-466d-80cb-5d6133fbb7c7","year":2023},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.662646Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:cc7c5030e35f40c382a8b9d13acf1d0416007fa9946663491fa8b63434960d2e","observation_id":"40fedbaa-ed58-438a-ac61-d11118b75316","resolution":{"observed_at":"2026-08-06T05:30:38.619902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T05:30:37.791480Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.791480Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:3f116dff50665b0bb43bd67d59d584c442b18950d988848a5d98c61c3bb5a7f5","observation_id":"fc61fe64-0088-4c2f-b95f-349400158007","resolution":{"observed_at":"2026-08-06T05:30:37.791480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:30:38.298446Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"1729f2fe-7de3-4797-a8a2-1e5f0d74aca1","year":2018},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.874247Z"},"links":{"citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:9c5dcc9923b7a5fb83e48d5783530c5f20e5d9f679002200c7e4af86dc34c33f","observation_id":"01d9109f-96a0-482e-a24e-52e57a29f998","resolution":{"observed_at":"2026-08-06T05:30:38.418588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-06T05:30:37.955324Z","title":"St- moe: Designing stable and transferable sparse expert mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:37.955324Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:c62d406aca2d79a80288d44efa02461379ddbfb368f8da3473de65287a8a152d","observation_id":"e2d15f56-e33b-49f5-9a5f-b9ea67da2ed7","resolution":{"observed_at":"2026-08-06T05:30:37.955324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":52},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 2 inbound Pith citation observations for arXiv:2508.01699."}