{"as_of":"2026-08-19T10:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b9b86166e6626616fda52cc1a42661b90a449e1840f8709a26b896b031ba050","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:12:37.935546Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:07:49.790348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13851","snapshot_observed_at":"2026-07-12T05:50:16.895740Z","title":"arXiv preprint arXiv:2505.13851 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02959","last_updated":"2026-07-03T05:05:59Z","snapshot_observed_at":"2026-08-14T18:17:57.192099Z","submitted_at":"2026-07-03T05:05:59Z","title":"Incentivizing Vision Language Models to Search for Long Video Question Answering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T05:50:16.895740Z"},"links":{"cited_paper":"/paper/2505.13851","citing_paper":"/paper/2607.02959"},"observation_digest":"sha256:f6f695572a2d2121a6ae8973e8659155a401eeefbd207f482c90d309dededb9c","observation_id":"867abc38-38c6-4c4c-9dcd-95d244eecd0f","resolution":{"observed_at":"2026-07-12T05:50:16.895740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13851","snapshot_observed_at":"2026-08-01T16:07:49.790348Z","title":"arXiv preprint arXiv:2505.13851 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18116","last_updated":"2026-07-20T16:11:19Z","snapshot_observed_at":"2026-08-14T10:04:06.196053Z","submitted_at":"2026-07-20T16:11:19Z","title":"SGA: Plug&Play Geometric Verification for Educational Video Synthesis","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:49.790348Z"},"links":{"cited_paper":"/paper/2505.13851","citing_paper":"/paper/2607.18116"},"observation_digest":"sha256:0a3922c10f1bb39b4c469c7f4deab10a6db7e309b539b07307a95a69b3921651","observation_id":"b6c0e8fb-65bf-418e-bb05-2d0f6145cbbc","resolution":{"observed_at":"2026-08-01T16:07:49.790348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13851/citation-record","integrity":"/paper/2505.13851/integrity","json":"/paper/2505.13851/citation-record.json","paper":"/paper/2505.13851"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.937894Z","title":"In 2019 IEEE 58th conference on decision and control (CDC), pages 5338--5343","venue":null,"work_id":"d8bf5611-a18a-4580-b439-264c97936014","year":2019},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.630186Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:6f136379c3e80040518a6cae7724849fdc366e7a4667e95aa400a4391c20c10d","observation_id":"9735a573-7a8c-4871-9572-e3aec62cc635","resolution":{"observed_at":"2026-08-15T20:12:38.942311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.924734Z","title":"Principles of Model Checking","venue":null,"work_id":"cc164c74-9f54-4eb4-bd0d-8a8bceea2214","year":2008},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.640288Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:253443d2476aca384092121b17e31aa57e64ba245de95803230c9e9c41b83ee6","observation_id":"6831c3f7-23a4-4c98-b754-46db89b2556a","resolution":{"observed_at":"2026-08-15T20:12:38.929596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.911814Z","title":null,"venue":null,"work_id":"ead67b11-59eb-4f8f-96b7-a94ea19ade39","year":2021},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.644893Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:ce02fce4d8ce6e8bcd111c16b64ffee35e617596fb2475ebbf1769d616f44b42","observation_id":"fa7957a3-740f-450a-a5d2-5c3cfd51d01f","resolution":{"observed_at":"2026-08-15T20:12:38.916064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.898423Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"4bbbd346-37d7-4559-821b-e7ae04c8bdce","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.648868Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:9f342b906c60eb3f162bf8ba58c208ed3c3d97be1a20ac2603f1d798fd17640a","observation_id":"53a35f3f-d6a7-4351-ac3d-15ad2981c3a0","resolution":{"observed_at":"2026-08-15T20:12:38.903547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.881953Z","title":"Hourvideo: 1-hour video-language understanding","venue":null,"work_id":"a37acfe9-d5d8-409f-b358-992aeb7b0597","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.653109Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:5d4b40b118ea7c57a31e74c88fed87bf7f753d42873b4a071d590b5194c98b7c","observation_id":"bc7292ec-8497-4bd6-8fb1-21fc3a270c1c","resolution":{"observed_at":"2026-08-15T20:12:38.889158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.865288Z","title":"Langchain, 2022","venue":null,"work_id":"f3c3f475-d964-45d8-9fcc-d72edbe2d7fc","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.658651Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b157d2213f7f3cd9fbe563ab3e070de2c4d7c4781905a7455a6d239c08015bb6","observation_id":"e138589a-bdaa-4835-8546-1350f997621a","resolution":{"observed_at":"2026-08-15T20:12:38.870148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01089","last_updated":"2022-05-02T17:59:13Z","snapshot_observed_at":"2026-08-18T14:48:46.149539Z","submitted_at":"2022-05-02T17:59:13Z","title":"ComPhy: Compositional Physical Reasoning of Objects and Events from Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01089","snapshot_observed_at":"2026-08-15T20:12:37.662733Z","title":"Comphy: Compositional physical reasoning of objects and events from videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.662733Z"},"links":{"cited_paper":"/paper/2205.01089","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:cee798baa1247407bbcdf2a9b5fd58375ea0acd2bc04d383760d36c340668ef4","observation_id":"8ff190ce-6749-488c-b5f4-47a00bcbc4f0","resolution":{"observed_at":"2026-08-15T20:12:37.662733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.851313Z","title":"Choudhary","venue":null,"work_id":"3bc6e01f-524a-48f3-a1f1-d65cdf56e595","year":2014},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.667154Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:83e4b7c5e51a6965fe38d9f24331b8a150cbe7c4c213142bd8f41f1d7769b7d8","observation_id":"f0f2c29c-4a05-499b-90b5-46ffa52a3be2","resolution":{"observed_at":"2026-08-15T20:12:38.856281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.671159Z","title":"Sora as an agi world model? a complete survey on text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.671159Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:55ca95083460b961634c7d8f902f5a7b2d3ff473008ba892fce14b8af56d3657","observation_id":"7567b5ad-4d7e-4c92-b450-9a7cf46da630","resolution":{"observed_at":"2026-08-15T20:12:37.671159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.838701Z","title":"Towards neuro-symbolic video understanding","venue":null,"work_id":"39d787a9-ac5a-4b7e-a972-80195c565375","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.676258Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:72af4c384625fe5e2331a2047b6b4c9da1b0d670050982d539471ffbf9e99429","observation_id":"41cd61bd-5fbe-40b1-86d6-ef7acece1221","resolution":{"observed_at":"2026-08-15T20:12:38.843209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-08-17T03:00:32.123465Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"cited_work":{"arxiv_id":"2504.17180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17180","snapshot_observed_at":"2026-08-15T20:12:38.205428Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","venue":"cs.CV","work_id":"eebcbf55-4dfb-40cb-ab2f-5eefbcfc0488","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.680624Z"},"links":{"cited_paper":"/paper/2504.17180","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e1d9cae309305502a3a20c21939c3b07b1dc1689237164a8040deb6b4e50a60b","observation_id":"b92ae639-df77-4e2b-b643-75e8bf5ceb04","resolution":{"observed_at":"2026-08-15T20:12:38.209822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05519","last_updated":"2025-05-08T03:27:12Z","snapshot_observed_at":"2026-08-18T12:59:23.324447Z","submitted_at":"2025-05-08T03:27:12Z","title":"Real-Time Privacy Preservation for Robot Visual Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05519","snapshot_observed_at":"2026-08-15T20:12:37.685123Z","title":"Real-time privacy preservation for robot visual perception","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.685123Z"},"links":{"cited_paper":"/paper/2505.05519","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:63ed0babdeffe1ecbdce7ffdee8525d0b41cc34f4cc77e898bd3eeb78360c4fd","observation_id":"e81aebdd-a2e9-4d82-97ae-ecd6cf9e27ee","resolution":{"observed_at":"2026-08-15T20:12:37.685123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.824352Z","title":"Parks research shows consumers are after integrated smart locks and security cameras","venue":null,"work_id":"afab0836-0aad-4afe-adfa-e5acd27eae81","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.690148Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:c1bcda9aaf715772ebcf68372d3ec52049567a4be7b3454f06d889f19e64c065","observation_id":"cc4d308a-aecf-4269-8762-95f95dcfa416","resolution":{"observed_at":"2026-08-15T20:12:38.829994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.810550Z","title":"Towards interpretable video anomaly detection","venue":null,"work_id":"06da3c5c-b8c3-4fc6-b113-848567e26a4c","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.695012Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:76c489ac18f53f34866a3946512c45d29cdcbabfd39700483a5ba8eb3312be30","observation_id":"a497cb8d-e782-4998-ba07-9f13565de877","resolution":{"observed_at":"2026-08-15T20:12:38.814856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.796088Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"ceef33c8-55fe-4cff-a51d-a50eabaf865d","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.698686Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e406eeeac069653fc3d8a94c704018a695eb5ddb97c67301f76448fe2502e7d1","observation_id":"bc736d57-a10b-4d3f-8286-96d77fc033e0","resolution":{"observed_at":"2026-08-15T20:12:38.802099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.783969Z","title":"Convolutional two-stream network fusion for video action recognition","venue":null,"work_id":"773ba70e-7b88-429d-86a3-bec96a832d32","year":1933},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.702757Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:3d6cb478a0dd6f4c0cdaf4df798a184b93535982582526a1f38a8bc8c7eabf0c","observation_id":"b4e23337-d344-4b8a-ad19-e4a2875b2b69","resolution":{"observed_at":"2026-08-15T20:12:38.788177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.772805Z","title":null,"venue":null,"work_id":"37745879-2e4c-45ff-bea3-49ee95515125","year":2017},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.707375Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:62ba04adaf50849c8c7d812f38926e7068e052942dca7849a685c0d6910ceec9","observation_id":"f1ccf334-3cc6-4ed8-8712-5a9590d99c4e","resolution":{"observed_at":"2026-08-15T20:12:38.776491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.758854Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"07eed355-4c96-4187-836f-bc34e159ccff","year":2019},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.711222Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:a1436fa20ab928cf716f3f95dabeeff7944080db2743035867bdfa8aea508d47","observation_id":"60f6e5dd-3ebf-49d7-9ad1-57a97330a47e","resolution":{"observed_at":"2026-08-15T20:12:38.763897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.715130Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.715130Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:87c02b1d77995f9e6fcd3ec3a7cdb8a2062e58b754602732c250c893155098b1","observation_id":"6948090a-3e78-45bc-b4ce-68050aead013","resolution":{"observed_at":"2026-08-15T20:12:37.715130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.739661Z","title":"The efficacy of neural planning metrics: A meta-analysis of pkl on nuscenes","venue":null,"work_id":"1cb89f38-04a9-485d-a4c9-d96f779eb025","year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.719067Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:a454dacb3c66bc4f4359d1ecee49e63688224efa3c5ef68e0324ef6bf2aa3e38","observation_id":"7e33e310-d468-4f3d-9a4f-e9a68882dcd4","resolution":{"observed_at":"2026-08-15T20:12:38.743640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.722597Z","title":"Stabletoolbench: Towards stable large-scale benchmarking on tool learning of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.722597Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:ff0fcf8e3af0b9ab808a71ed9c7877a56232098ca09c228aad26edbba90d1b2e","observation_id":"eaafed71-be0e-4534-99f8-7f53631625ac","resolution":{"observed_at":"2026-08-15T20:12:37.722597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.726478Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.726478Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:a909ac8c081d77a4fa667b7cefe1a1497daffda3843f28377a1b69107497f8ce","observation_id":"f1b4c00d-c025-4014-927a-7ba6fb8797a5","resolution":{"observed_at":"2026-08-15T20:12:37.726478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-15T20:12:37.731908Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.731908Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:97ce1978b4e41ad9b7e3cb0c779f4bb8a226fbde2b5046c2aac023df032d9f9e","observation_id":"aabb3fd2-ea12-48ac-a8e0-b8e93c839fd8","resolution":{"observed_at":"2026-08-15T20:12:37.731908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.736434Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.736434Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b28aa57e8ad64c2e5dba9c011e68d3284db592018df2c63f593193d955127562","observation_id":"24809207-4feb-476d-ac2f-75e755ac1b33","resolution":{"observed_at":"2026-08-15T20:12:37.736434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20252","last_updated":"2024-10-26T19:01:06Z","snapshot_observed_at":"2026-08-18T14:50:46.763237Z","submitted_at":"2024-10-26T19:01:06Z","title":"Adaptive Video Understanding Agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20252","snapshot_observed_at":"2026-08-15T20:12:37.741594Z","title":"Adaptive video understanding agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.741594Z"},"links":{"cited_paper":"/paper/2410.20252","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:d9730c215921b235fb22cbcf67b8549887e0fe765f89df6c10fcdc01cdb0be58","observation_id":"dbc2d06c-2170-4dbd-991e-607de1ab895a","resolution":{"observed_at":"2026-08-15T20:12:37.741594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.706612Z","title":"Safe autonomy under perception uncertainty using chance-constrained temporal logic","venue":null,"work_id":"581f1a16-81ff-484d-b652-20450c0877cb","year":2018},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.745875Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:fc5c4778747b7664ab8203910d5459cdb5bc0041657ad72b38544e61c6c9fe60","observation_id":"dce12e36-8334-4b06-a80c-f6469c6690be","resolution":{"observed_at":"2026-08-15T20:12:38.710616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.750582Z","title":"Tsaftaris, and Aggelos K","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.750582Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:9829cdf43d48dfde5c87304d918fc31485244c30add398677d34c7971773aec8","observation_id":"29778a5f-0ac2-4fef-b8a9-12399fdaef42","resolution":{"observed_at":"2026-08-15T20:12:37.750582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.693585Z","title":"Temporal-logic-based reactive mission and motion planning","venue":null,"work_id":"4c30cfd2-ffb5-4ea3-a863-a6d980dd03ae","year":2009},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.754257Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:317eda95508ed67cecd96305287f5b40e5eb1ad0a5a029700830792789e05781","observation_id":"9b337289-ff70-4f8c-b2f5-2096e55c4c3b","resolution":{"observed_at":"2026-08-15T20:12:38.698024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.681975Z","title":"A neural-symbolic approach to computer vision","venue":null,"work_id":"b31c2e2a-bc5a-4d43-93de-266299f3ba20","year":2021},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.758293Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:782617ff804660a9d3588d8e49dc36b982a1678d90792edb130dc45aa1602284","observation_id":"8097b98c-0bf9-4b2a-b7be-5b3080cf7bcf","resolution":{"observed_at":"2026-08-15T20:12:38.686308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.669817Z","title":"Pika ai: Free video generator with scene ingredients, 2024","venue":null,"work_id":"e78eaef7-8423-40d8-b463-a8845ad9f9f7","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.762797Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:adf3b555c158c06c891dae198070c886105d67138ce9e337386c5fc2995411e2","observation_id":"bed02405-314a-4689-b528-ff84e779a6d9","resolution":{"observed_at":"2026-08-15T20:12:38.674115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.657561Z","title":"Human-related anomalous event detection via spatial-temporal graph convolutional autoencoder with embedded long short-term memory network","venue":null,"work_id":"7ace1844-3641-4f33-88e2-b2b7af4450c6","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.766489Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:c444b28e70536cebf3c78cbdb92fefb9f5fbcb0f25185f87d599ccd196a6b4cb","observation_id":"738b471e-f590-44a0-90d8-0a6cb0d28167","resolution":{"observed_at":"2026-08-15T20:12:38.661618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-15T20:12:37.770125Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.770125Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:fabdfd8d8b3ff11b99d0b54d981cf70426acd154ef64806d2abb921f85601dd9","observation_id":"2335cd9b-cab6-4e81-86b0-eae069542e70","resolution":{"observed_at":"2026-08-15T20:12:37.770125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.645659Z","title":"Representation learning on visual-symbolic graphs for video understanding","venue":null,"work_id":"526daa50-5666-4c27-9329-6d4c1a0fcad9","year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.774332Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:60eb7b941529a62d43c4b61e135cc465bcbd621e2a951f65f0c159d60a5bb662","observation_id":"a59c1b95-db6d-49fd-b702-dba9feb0bc97","resolution":{"observed_at":"2026-08-15T20:12:38.650212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.632000Z","title":"Medioni, Isaac Cohen, Fran c ois Br \\' e mond, Somboon Hongeng, and Ramakant Nevatia","venue":null,"work_id":"17a5d0b1-f8bc-4ee2-8977-0cfb71e41388","year":2001},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.778258Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:097aa48ec817b30c74a815e6da8c50c6c80aa42274d9851a2e88e71a02a4e88b","observation_id":"3423089d-d6fc-48d0-a420-25ebbf955fa8","resolution":{"observed_at":"2026-08-15T20:12:38.637374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.619473Z","title":"Formal methods to comply with rules of the road in autonomous driving: State of the art and grand challenges","venue":null,"work_id":"a7aa5908-110e-4d60-9552-20fae4e5b4c9","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.782221Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:53b1507edce0e9a06f4377463bc3bcd71add6af44855b7c8ada0791a08d942ee","observation_id":"0bf424f4-1809-4da7-b4f2-bfce4cccd102","resolution":{"observed_at":"2026-08-15T20:12:38.623587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.606502Z","title":"8 must-follow social listening trends for 2025, January 2025","venue":null,"work_id":"936f627f-892c-45aa-818f-7e683d001756","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.786453Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e6b9490a6829181fa41210db95a566fa18a9dbac9a619e54e0421b9df605387a","observation_id":"4f7d6e52-cc40-4282-be7b-4d799373607b","resolution":{"observed_at":"2026-08-15T20:12:38.610632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.592757Z","title":"Learning audio-video modalities from image captions","venue":null,"work_id":"e09dd239-1284-49d0-9bcd-b66996d2b38b","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.789977Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:1cfca75b902d3fa433d0294d010dfeb1369b80cc11685a4e49ae783e2ff3112b","observation_id":"8d32f684-f89d-43a9-ac55-5f4ff25a60f7","resolution":{"observed_at":"2026-08-15T20:12:38.597969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.576948Z","title":"Federal motor vehicle safety standards; automatic emergency braking systems for light vehicles","venue":null,"work_id":"c9a38e78-fbc9-4c95-94bd-c8dc3a0ad394","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.794335Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:8e73548b7f67426df3bb14b7994fea1bbfb8e3f51078a7e4491d5685de0c2ef5","observation_id":"00895aae-9a46-4c63-bb57-0e619cff48cf","resolution":{"observed_at":"2026-08-15T20:12:38.582430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:12:37.797834Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.797834Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:4a5298aac319dfebfe106181cc3681395adfde2c90de62d68196f100391db1cc","observation_id":"12bb363c-e1fd-4cde-997f-bebe1db94f8e","resolution":{"observed_at":"2026-08-15T20:12:37.797834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.563136Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":"dfabc6ca-0383-4a05-a68c-7c3a30555bed","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.801936Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b847beaff630ff313ad72ed3a5866458a8347616b70a11ec6d9daf01e90031d1","observation_id":"cda27a41-ce49-4ecb-bfe6-5a9dd190e11f","resolution":{"observed_at":"2026-08-15T20:12:38.568461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-08-14T14:07:14.900729Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-15T20:12:37.806971Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.806971Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:a49500b04bec4a0774c5a1f2cc6b401ea1f5aa646717ab7fa8a61a7875480759","observation_id":"6e63a228-7da0-4400-b57e-6d8210ccbae3","resolution":{"observed_at":"2026-08-15T20:12:37.806971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.811659Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.811659Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:3d26ae99b0a56028b9ba4640aeba440fda100885340075c240bbc508f73ae6b2","observation_id":"733bf8e6-fa5a-423a-a37e-8a52d352a409","resolution":{"observed_at":"2026-08-15T20:12:37.811659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.542940Z","title":"Rapidapi hub","venue":null,"work_id":"9f4fe1d4-73b9-4cda-888e-184992eef8a8","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.815835Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:bddd330fb1436e222dc41ae885263a8efc57ec78a61c6032951563a3739ade6e","observation_id":"59ab042d-7e39-4940-ae2b-4dbc2a09597a","resolution":{"observed_at":"2026-08-15T20:12:38.546900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.529575Z","title":"Introducing gen-3 alpha: A new frontier for video generation, 2024","venue":null,"work_id":"e76e0de0-cf2f-41c8-bd87-a99ea555e2f3","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.819404Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:04e062d65cde9fb0ece753535c53ab74778c6c174d182bca2a407b8bf7724c72","observation_id":"15021405-cc0f-485b-805f-2e4339d76eff","resolution":{"observed_at":"2026-08-15T20:12:38.534683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.518247Z","title":"Early detection of combustion instability by neural-symbolic analysis on hi-speed video","venue":null,"work_id":"ac6f07d4-9e6e-4ac1-9898-deb016cfef63","year":2015},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.822935Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:14b246a10eb1f383038e8c3922e44f951627082765cb0bafb4e729d677d6b903","observation_id":"9581fbea-01b9-458a-ad3e-b2384b5c4265","resolution":{"observed_at":"2026-08-15T20:12:38.522525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-18T14:50:45.868697Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"cited_work":{"arxiv_id":"2411.16718","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16718","snapshot_observed_at":"2026-08-15T20:12:38.094834Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","venue":"cs.CV","work_id":"cd2d78d6-657b-42e5-9d39-c0580899ba11","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.827131Z"},"links":{"cited_paper":"/paper/2411.16718","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:f2522ad4245c3b901c12045a29d3c6d41ce549ff354670c6575945d24beeb6f1","observation_id":"03be9951-6b02-4ba4-b82c-30f37c80e96b","resolution":{"observed_at":"2026-08-15T20:12:38.101767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.505460Z","title":"Linear temporal logic motion planning for teams of underactuated robots using satisfiability modulo convex programming","venue":null,"work_id":"5881367b-5927-4936-8afa-6210fabb36a5","year":2017},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.830959Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:268a983d7d80961e4174558a9ba21209c6e22e0926f2f2af9d3471bac6dea3c9","observation_id":"d91204f2-d990-4edd-816d-cc5a803fe063","resolution":{"observed_at":"2026-08-15T20:12:38.509704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.493447Z","title":"Shultz and Richard D","venue":null,"work_id":"903853e7-9d33-49fe-8ce0-618a99a6a499","year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.834603Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:6d6262433e98728997e2015e23b3b26e5b25cfb88eb751453f5131aadbaed968","observation_id":"4f4b3b50-f84e-40d4-a588-6f95915a78aa","resolution":{"observed_at":"2026-08-15T20:12:38.497389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10076","last_updated":"2025-02-09T05:57:42Z","snapshot_observed_at":"2026-08-18T15:03:20.669874Z","submitted_at":"2024-10-14T01:39:56Z","title":"VideoAgent: Self-Improving Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10076","snapshot_observed_at":"2026-08-15T20:12:37.838575Z","title":"Videoagent: Self-improving video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.838575Z"},"links":{"cited_paper":"/paper/2410.10076","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b0542886adbb7a65e9edea889dc236fb4fd2c711b68186cc406fadaa3f955510","observation_id":"e423d689-7017-4bce-a6ee-1baa6651bd2a","resolution":{"observed_at":"2026-08-15T20:12:37.838575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.481631Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"4d252ed0-077c-4792-b0db-5722e0161984","year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.843630Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:289c899e462b8d8d7e36f3bfa60eb5ec5e166d88d361a3ea1d4eccf4afce7b34","observation_id":"112858a6-bb3b-4076-8e75-be239a51a244","resolution":{"observed_at":"2026-08-15T20:12:38.485727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T20:12:37.847534Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.847534Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:9424fca02961f02579e9f908749efed6a0a29bfc0accb1a8534818d1fb259952","observation_id":"358a5ee7-c886-4bf2-a34c-7676c203f0ba","resolution":{"observed_at":"2026-08-15T20:12:37.847534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:12:37.851578Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.851578Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:627e64c470b31567eb08ed5692cc230926eed40cafa7400c856b341263830e03","observation_id":"907d582c-7805-4444-8023-bc218adb79cd","resolution":{"observed_at":"2026-08-15T20:12:37.851578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.468715Z","title":"Video classification with channel-separated convolutional networks","venue":null,"work_id":"5ee216a0-bd6a-442f-8833-e932236cb35e","year":2019},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.855757Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:f96405330ace099a9d4bbb1ca4dab8b8ec66df14afdcaafb3a9aac582ddb9cd2","observation_id":"2d9b4d22-5926-4e9f-9397-a2d0c1a00ac1","resolution":{"observed_at":"2026-08-15T20:12:38.473731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.455798Z","title":"Twilio: Cloud communications platform, 2025","venue":null,"work_id":"f9167ff6-def2-417d-9e52-05ce7199d653","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.859602Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:4747d73a9cf0cf6cfc9ec4660749cbc867ba6f8120ca172ea0ca285fd062b165","observation_id":"cb95453b-dea5-4942-b1d3-40dfeabc63af","resolution":{"observed_at":"2026-08-15T20:12:38.460428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-15T13:11:17.068630Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-15T20:12:37.863553Z","title":"Phenaki: Variable length video generation from open domain textual description","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.863553Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:50cd28fa28da3125359502617e3589c441e38f60e9d2b4296defe85dd6e2294f","observation_id":"3e8ddd96-625e-4479-9c75-e9d041c65650","resolution":{"observed_at":"2026-08-15T20:12:37.863553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.443608Z","title":"Lave: Llm-powered agent assistance and language augmentation for video editing","venue":null,"work_id":"5f92316c-c030-44ac-a3ba-d698e25ae68e","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.868061Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:4c1fe6c790674e72761f3ba0a839b4502ca253ae5eb822758498c108a9434d7a","observation_id":"514fada2-65fe-4e86-934b-60dffde979c4","resolution":{"observed_at":"2026-08-15T20:12:38.447832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.429851Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"af1e6c3f-6cbf-4a06-8bca-1c605edbf923","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.872219Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:5dde6ca9f3f478516d72e99db38505809f6be30cae18244f56e63e141d4b024f","observation_id":"e5fffafe-c83f-4919-ad93-5698cd2fc9b0","resolution":{"observed_at":"2026-08-15T20:12:38.434916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-15T20:12:37.876207Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.876207Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b8a127764668da8a1d2553dcb06c5947989c71a1b9947d2d5c1c0e2a8dfdb006","observation_id":"a314f256-c948-471a-81b8-34c797c3002d","resolution":{"observed_at":"2026-08-15T20:12:37.876207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.417072Z","title":"Discovqa: Temporal distortion-content transformers for video quality assessment","venue":null,"work_id":"a5825236-fe69-4793-8210-192d7599dfcb","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.880887Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:c8b34e30ebecbadad39555ccd0cbc107f2957fe72622dd541ef79cb6c4c8dd7d","observation_id":"0dd12723-69b4-407d-8032-fcf61d90973d","resolution":{"observed_at":"2026-08-15T20:12:38.421781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.402615Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"f83bef7c-3e85-47d0-9ef1-ddfb6e780ff7","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.890455Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:0c137f146c631e4de94d82dfab32962d9b35a519aa9fb0d83e135006d9f45125","observation_id":"f1711f3a-f577-461d-853a-92bae6e38ed1","resolution":{"observed_at":"2026-08-15T20:12:38.408757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.387488Z","title":"A graph-based framework to bridge movies and synopses","venue":null,"work_id":"a1a5a5f9-c195-429c-9ef7-fa883d243f98","year":2019},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.895422Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:c3e51caf1ff96e4df834201c8cd5bb22b353b4c520791642a02e753545de7016","observation_id":"94821730-d236-48d2-b876-4f1f0e4b04b3","resolution":{"observed_at":"2026-08-15T20:12:38.392378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.899906Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.899906Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:55e0bc9f9c533a2d6926d3931209594e6938fbb91c4249f1ad89c768eafffa4b","observation_id":"f6951e0d-5ee5-407f-b184-b3c3ac23eb14","resolution":{"observed_at":"2026-08-15T20:12:37.899906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.365974Z","title":"Hauptmann","venue":null,"work_id":"5c080cdb-c227-4acc-a5c8-b886505fdcc2","year":2015},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.903671Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:86b42acaf7bc572718ae3db531a94d0279e4d7ca7ef35a39078160239a3bf868","observation_id":"aac87d70-054d-4842-839b-9054d1c40561","resolution":{"observed_at":"2026-08-15T20:12:38.370660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10171","last_updated":"2023-09-18T21:40:08Z","snapshot_observed_at":"2026-08-18T14:53:28.764266Z","submitted_at":"2023-09-18T21:40:08Z","title":"Specification-Driven Video Search via Foundation Models and Formal Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10171","snapshot_observed_at":"2026-08-15T20:12:37.907486Z","title":"Specification-driven video search via foundation models and formal verification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.907486Z"},"links":{"cited_paper":"/paper/2309.10171","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e4eda3d9e2c2cc5a51166cae8bbc9e299b08e4f1c0b7e88f535f4b811e523af0","observation_id":"75b9bfce-61d0-4dde-86ec-cac5cf08f154","resolution":{"observed_at":"2026-08-15T20:12:37.907486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-15T20:12:37.911855Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.911855Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:8fc06717ff47b8a5b5aaebf3f3ce32e58ba0aeb1a38705a1b52e3b7cad5452f2","observation_id":"606c09b5-9861-4122-9d55-163c5dfabbf2","resolution":{"observed_at":"2026-08-15T20:12:37.911855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.916529Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.916529Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b1d9bc289ce1aebc092484f1e81b2c40fd87ef49f5cd71580039eddb23115a36","observation_id":"ee854281-90a0-4b39-964b-60e5e8eef2b3","resolution":{"observed_at":"2026-08-15T20:12:37.916529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.343339Z","title":"Neural-symbolic VQA: disentangling reasoning from vision and language understanding","venue":null,"work_id":"a9707bbc-a028-49d8-b9d2-ee43a82d13f3","year":2018},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.920569Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e05723ebb0419b89e49e29fb12fd2fbeb65e5e9f6e193e0ebfb06f41a13c8ceb","observation_id":"e208524f-70b6-4513-b00a-b63f287e9a97","resolution":{"observed_at":"2026-08-15T20:12:38.347806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.330059Z","title":"A probabilistic graphical model based on neural-symbolic reasoning for visual relationship detection","venue":null,"work_id":"d3bd55bc-7da2-442f-9f61-9ce0fff71804","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.924353Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:048ccb80662d0e49d215e2b96b79859c5cf5459174caebb83ab617b340ed65c5","observation_id":"30c2dae2-e768-49f9-87b2-c7c9314d5eab","resolution":{"observed_at":"2026-08-15T20:12:38.334377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-15T20:12:37.928130Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.928130Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:cfd0171ecb7ecbe3f0152e2cdd1cd584bf45cb057cf9c7c2eb926d596698be24","observation_id":"ee7345f8-4105-46e6-a41e-11b703efe8b8","resolution":{"observed_at":"2026-08-15T20:12:37.928130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-15T20:12:37.931752Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.931752Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:d79dfce10070e4dd57b35edf012c2a5bcc38a4c3989982d0ad9017b2620f2814","observation_id":"787a5d85-77ac-482f-b443-ed0e42b9169a","resolution":{"observed_at":"2026-08-15T20:12:37.931752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.317234Z","title":"Abnormal event detection by a weakly supervised temporal attention network","venue":null,"work_id":"a3612213-e977-4a7a-acf9-d1e6c66b14ae","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.935546Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:26faf73b72a63127be2e3394de8fa622467662e6cbb824411591b3fe7c09827c","observation_id":"276b431e-0376-4591-973d-015d548758e9","resolution":{"observed_at":"2026-08-15T20:12:38.321696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T03:01:18.384329Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":42},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2505.13851."}